AIDC
DC AI 热点

全部 AI 动态

9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 68/10012:00

可控多元对齐研究:预测目标冲突并高效覆盖多目标权衡

该论文针对大型语言模型多元对齐中价值观冲突的问题,研究了可控模型如何在竞争性目标间平衡权衡。多目标直接偏好优化(MODPO)通过目标权重覆盖连续权衡区间,本研究探讨了模型何时可同时提升两个目标,以及如何避免为每种权衡单独训练模型。基于HelpSteer和UltraFeedback的七组目标测试,研究提出了可预测目标冲突的预训练测量方法,以实现更高效的多元对齐。

阅读原文 ↗推荐理由:针对多目标对齐与个性化偏好优化的前沿理论研究,有助于提升大语言模型动态权衡多种冲突需求的能力。# 多目标对齐# 偏好优化# MODPO# 大模型# 对齐
arXiv 人工智能✦ 精选AI 评分 75/10012:00

相同证据不同判定:多模态大模型在图文及语音文本冲突中存在证据不可交换性

该论文探讨了多模态大语言模型在图像或语音与伴随文本发生冲突时的偏好机制。针对以往文本偏置研究中证据顺序固定或指令位置变化导致成因不明的问题,研究团队采用配对比较法,在固定指令与证据内容的前提下仅互换两类模态信息的输入顺序。实验覆盖视觉与语音模型,发现将图像或音频置于冲突文本之后会持续改变模型判定,证实了模型处理冲突证据时存在显著的顺序敏感性与不可交换性。

阅读原文 ↗推荐理由:深入探讨了多模态大语言模型在多模态冲突场景下的位置偏差与模态依赖机制,对模型鲁棒性评测具参考价值。# 大模型# 模态冲突# 位置偏置# 前沿研究# 可解释性
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于子任务分解的强化学习方法:改进大语言模型策略优化

针对群组相对策略优化(GRPO)等主流策略梯度方法在训练语言模型智能体时将多轮交互压缩为单一标量轨迹奖励的痛点,研究指出该做法在稀疏和延迟反馈的多技能复合任务中存在严重的信息损失,优化器难以推断具体能力对结果的贡献。为此,论文提出应将轨迹奖励沿子任务进行解耦与分解后再进行策略更新,从而实现更精准的信用分配与行为调整。

阅读原文 ↗推荐理由:针对大模型强化学习主流算法GRPO在多轮复杂任务中奖励归因模糊的核心痛点,提出了子任务奖励分解的优化思路。# 强化学习# 语言模型智能体# 策略优化# 奖励建模
arXiv 人工智能✦ 精选AI 评分 70/10012:00

利用可控合成对话训练智能语音助手唤醒系统

该研究针对虚拟助手的人机交互场景,提出了一种新型语音唤醒系统。该方案将传统的直接关键词检测扩展为上下文触发检测,在初始唤醒词激活后,系统利用推理能力区分实际用户指令与无关语音,从而确保高效且具备上下文感知的交互。为支撑训练,研究团队设计了一套数据生成架构,成功合成了包含直接调用、上下文跟进等场景的62.3小时可控多说话人对话语料库。

阅读原文 ↗推荐理由:针对智能助手误唤醒痛点,提出了结合上下文推理的唤醒机制及配套的合成对话训练方案。# 语音# 唤醒词检测# 合成数据# 上下文感知# 人机交互
arXiv 人工智能✦ 精选AI 评分 75/10012:00

大模型陈述的推理步骤是否真正承载因果权重?

思维链(CoT)监控通常假设模型生成的推理过程真实反映了得出答案的计算机制。以往评估推理真实性的指标主要停留在行为层面,即通过修改推理文本来观察输出变化。该研究提出一种在激活层面测量自生成推理真实性的因果分析方法。与以往仅评估性能衰减的因果审计不同,该方法通过带有已知反事实目标的激活干预,验证每一次干预是否能将答案切换至特定的反事实实体,从而精确评估推理步骤的因果支撑度。

阅读原文 ↗推荐理由:该研究深入模型激活层面验证思维链推理的因果真实性,为大模型的可解释性与推理可靠性评估提供了关键方法。# 思维链# 可解释性# 因果分析# 前沿研究# 大模型
arXiv 人工智能✦ 精选AI 评分 74/10012:00

大语言模型数学推理机制按方法而非学科主题组织

一项针对大语言模型内部计算机制的研究显示,开源数学模型在处理问题时更倾向于按可复用的“推理方法”而非传统的“学科主题”组织内部计算。研究团队提出了一种“生成-重放协议”,先由模型生成解题步骤,再重放完整的提示词与生成轨迹,借此提取推理 token 的激活重要性特征并进行无监督聚类。该研究为理解 LLM 如何在内部表征和执行数学推理提供了新的可解释性视角。

阅读原文 ↗推荐理由:揭示了大模型内部按通用求解方法而非学科主题组织数学推理的计算机理,具有理论研究价值。# 大模型# 数学推理# 可解释性# 前沿研究# 注意力机制
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于大语言模型的可证明完备泛化规划方法

该研究针对泛化规划中方案完备性难以形式化验证的问题,提出了一种基于大语言模型(LLM)的新框架。此前利用 LLM 生成 Python 代码形式泛化规划的方法,只能依赖人工评估来确认其是否能解决领域内的所有实例。为此,研究团队提出利用交互式定理证明器 Lean 自动生成泛化规划,并同步产出基于领域约束规范的完备性数学证明,实现了对泛化规划正确性与全域覆盖能力的机器可验证保障。

阅读原文 ↗推荐理由:将大模型代码生成与 Lean 形式化证明相结合,解决了 AI 泛化规划完备性难以自动验证的关键难题。# 大模型# 泛化规划# Lean# 形式化验证# 自动推理
arXiv 人工智能✦ 精选AI 评分 75/10012:00

XLOG:面向神经符号集成的 CUDA 原生逻辑编程引擎

论文提出了用于神经符号集成的 CUDA 原生逻辑编程引擎 xlog。该引擎通过类型化前端与 CUDA 运行时,将神经感知与确定性 Datalog、概率推理及认知世界观相结合。各推理模式共享 GPU 设备数据平面,其中常驻递归与蒙特卡洛采样核心在特定推理阶段实现了零主机-设备数据传输开销。此外,其概率推理路径支持通过 GPU 知识编译完成端到端梯度计算,显著提升了神经符号推理的硬件执行效率。

阅读原文 ↗推荐理由:提出了一种面向神经符号推理的 CUDA 原生逻辑编程引擎,在 GPU 层面优化了符号逻辑与深度学习的集成效率。# 神经符号系统# 芯片# 概率推理# GPU加速
arXiv 人工智能✦ 精选AI 评分 80/10012:00

腾讯发布Hunyuan-A13B开源MoE模型技术报告

该技术报告介绍了开源大语言模型Hunyuan-A13B。该模型采用混合专家(MoE)架构,总参数量为800亿,推理时仅激活130亿参数,有效兼顾了模型性能、计算效率与部署成本。模型在经过严格清洗且强化STEM领域的20T token语料上进行预训练,并结合高质量SFT与大规模强化学习,同时引入了双模式思维链(CoT)框架,显著提升了事实可靠性与逻辑推理能力。

阅读原文 ↗推荐理由:混元开源80B MoE大模型并公开技术报告,其激活13B参数的设计对端侧及高效部署极具参考价值。# 混元大模型# MoE# 开源# 大模型# 模型架构
arXiv 人工智能✦ 精选AI 评分 75/10012:00

长程智能体在行动前即可涌现记忆控制信号

针对长程语言模型智能体因持续积累交互历史而导致算力成本增加、关键信息难以保留的问题,本研究深入分析了智能体执行动作前的内部隐藏状态。研究发现,模型在采取行动之前,其内部表征已自发编码了对上下文压缩和召回等记忆操作的控制需求,且这些信号无法仅由简单的上下文统计特征解释。该成果揭示了模型内生管理记忆的潜在能力,为设计更高效的长程智能体记忆机制提供了新视角。

阅读原文 ↗推荐理由:揭示了大模型智能体内部在行动前即已表征记忆控制需求,为优化长程任务的上下文管理机制提供了理论依据。# 语言模型# 智能体# 记忆# 模型表征# 前沿研究
arXiv 人工智能✦ 精选AI 评分 73/10012:00

PotARCin:多维度评估抽象推理任务技能习得的新基准

该研究针对人工智能在抽象推理基准ARC中仅评估单一网格生成能力的局限性,提出了新型评估基准PotARCin。研究人员指出,传统的单一测试格式无法充分衡量模型是否真正掌握了抽象技能。为此,PotARCin从任务底层抽象规则的理解出发,在定义、分类、约束生成和编辑等五个维度上对模型进行综合评测,以更全面地检验AI模型的通用抽象推理能力与流动智力。

阅读原文 ↗推荐理由:针对经典抽象推理基准ARC进行了多维度拓展,提出了更全面的大模型流动智力与规则理解评估框架。# 抽象推理# ARC# PotARCin# 评测
arXiv 人工智能✦ 精选AI 评分 65/10012:00

面向气候感知数字孪生的物理信息神经网络稀疏观测大气温度预测

为支持气候感知数字孪生系统,该研究针对热观测数据不完整条件下的短期大气温度预测展开探索。论文评估了一种用于位温预测的物理信息神经网络(PINN),该模型受到气压坐标热力学平流-源方程以及从前12小时拟合且在预测训练前冻结的非绝热源闭合项的物理约束。研究采用三个气压层的逐小时ERA5再分析数据,对模型在1至3个时效步长下的条件后验预测性能进行了验证。

阅读原文 ↗推荐理由:探索将物理信息神经网络(PINN)应用于稀疏观测环境下的气象短期预测,为数字孪生与科学智能计算提供了参考思路。# PINN# 物理信息神经网络# 数字孪生# 气象预测# AI for Science
arXiv 人工智能✦ 精选AI 评分 75/10012:00

大知识模型(LKM):将学术文献转化为科学推理全景图谱

研究人员提出了大知识模型(LKM),这是一种旨在将学术文献转化为可计算科学推理资源的新型知识基础设施。为打通科研问题、实验流程、结论与证据间的逻辑连接,LKM 将学术论文表示为具备源依据的推理图谱,并结合结构化图遍历与语义检索技术。该架构使海量文献沉淀为可共享的计算资产,能够辅助科研人员探索新课题、设计实验方案并深入解读研究结果。

阅读原文 ↗推荐理由:提出了结合推理图谱与语义检索的大知识模型概念,为 AI for Science 及学术文献的自动化深度推理提供了新范式。# 大知识模型# AI for Science# 知识图谱# 科学推理# 语义检索