AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 机器学习✦ 精选AI 评分 78/10012:00

混合推理模型中的“思考泄漏”:NoThink后训练机制因果审计

针对混合推理模型在无显式思考(NoThink)模式下的后训练机制,本研究探讨了其性能提升是否源于基座模型“思考(Think)”模式能力的潜在迁移。作者将这种“思考泄漏”纳入因果中介分析框架,并基于激活方向的双向干预进行审计。在3个模型、3种后训练方法及竞赛数学基准上的实验表明,“思考泄漏”在行为和表征层面均真实存在、具备因果性且影响显著,揭示了快推理模式下的内在表征机制。

阅读原文 ↗推荐理由:该研究通过因果干预实验深入揭示了混合推理模型在快速推理模式下性能提升的本质来源。# 推理# 因果分析# 可解释性# 模型后训练# 推理机制
arXiv 人工智能✦ 精选AI 评分 75/10012:00

SLCA-GRPO:解决工具调用强化学习中的跨段信用分配错误

具备工具调用能力的智能体通常交替生成结构化工具调用和自然语言总结。现有同策略强化学习算法(如GRPO)由于将整条轨迹的单一优势值无差别广播至所有Token,导致总结生成中的梯度噪声泄漏至工具决策Token,引发跨段信用分配错误与优化不稳定。为此,研究者提出了SLCA-GRPO框架,通过引入分段锁定的信用分配机制,有效隔离噪声并提升了工具调用策略训练的鲁棒性。

阅读原文 ↗推荐理由:针对智能体工具调用在强化学习(GRPO)训练中的信用分配缺陷提出针对性改进,对提升智能体决策稳定性具有实用参考价值。# 强化学习# 智能体# 工具调用# 信用分配
arXiv 机器学习AI 评分 58/10012:00

面向 AnDE 分类器的联邦学习框架研究

该研究提出了一种在分布式环境中训练平均 n-依赖估计器(AnDE)的联邦学习框架。该方案重点关注判别式设定,模型权重在本地学习后进行全局聚合,并支持任意依赖阶数 n。由于无需传输具有直接语义的参数,该设计显著提升了隐私安全性。此外,研究还实现了生成式 AnDE 联邦基准,支持在概率表聚合中引入差分隐私,并在 12 个离散数据集上完成了有效性验证。

阅读原文 ↗推荐理由:提出了一种面向 AnDE 分类器的新型联邦学习框架,兼顾了高阶依赖建模与隐私保护。# 隐私计算# 分类器# 机器学习# 分布式计算
arXiv 人工智能✦ 精选AI 评分 76/10012:00

从自我蒸馏到自我练习:多轮智能体特权信息利用机制研究

该研究探讨了大模型多轮智能体训练中策略内自我蒸馏(OPSD)范式的缺陷。该范式利用特权信息构建强教师模型进行词元级监督,但在多轮交互中,学生智能体会表现出脱离实际信息的盲目自信,误以为自己掌握了未曾观测到的特权信息,导致性能大幅落后于普通强化学习,甚至劣于基座模型。为此作者提出了新范式;由于原文摘要截断,新方法细节尚未完全展开。

阅读原文 ↗推荐理由:深入剖析了多轮智能体后训练中特权信息蒸馏的失效机理,为改进Agent训练范式提供了重要参考。# 智能体# 蒸馏# 强化学习# 特权信息# 模型后训练
arXiv 自然语言处理AI 评分 58/10012:00

BanglaTurn:面向孟加拉语语音话轮结束检测的基准语料与Whisper模型

该研究提出了用于孟加拉语对话语音话轮结束(End-of-Turn)检测的基准语料库BanglaTurn及配套模型。该语料库包含35,374段时长3至15秒的播客语音,通过说话人日志结合大语言模型初标并经人工全面核验。研究构建了结合Whisper编码器与特定任务分类头的模型,在平衡测试集上达到84.33%的准确率,较基线Smart-Turn v3的69.28%显著提升,并将假阴性率从51.57%降低至7.5%。

阅读原文 ↗推荐理由:针对低资源语言孟加拉语构建了对话话轮检测基准和微调模型,有效改善了语音交互中的停顿与轮换判断性能。# 语音# Whisper# 话轮检测# 对话系统
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

大模型评估研究:似然排序在规模扩展表现上不同于提示词方法

该研究探讨了大语言模型(LLM)的评估方法。在多项选择问答任务中,常规基于似然的评分与提示词方法类似均依赖任务上下文。研究团队提出了一种基于问答对构建的陈述句进行似然排序的补充评估协议。通过对95个参数量从1亿到1040亿的仅解码器模型在10个多选题数据集上的测试,系统对比并揭示了似然排序与提示词方法在模型规模扩展表现上的差异。

阅读原文 ↗推荐理由:通过跨越近百个模型的大规模实验,揭示了大语言模型在似然排序与提示词评估方法上的扩展性差异。# 大模型# 评测# Scaling Law# 似然排序# 提示词工程
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

受控实验复检极小规模三值语言模型:基线架构设置主导性能评估结论

该研究针对微控制器级的三值(1.58-bit)权重语言模型进行了严格的受控复验。此前有研究称混合路由三值模块在6万参数规模下性能超越参数匹配的全精度Transformer达22%,并归因于归纳偏置。研究人员通过固定训练配方、多随机种子及98次测试进行复查,发现基线Transformer的具体结构形状对性能起主导作用,揭示了此前结论可能受基线设计差异误导,强调了极小模型对比的评估规范。

阅读原文 ↗推荐理由:严谨复查了超低参数量三值语言模型的实验基线,揭示了模型评估中易被忽视的基线结构偏差。# 模型压缩# 模型架构# 评测# 边缘计算
arXiv 机器学习✦ 精选AI 评分 70/10012:00

强化学习中的策略复杂度、反应时间与有限理性研究

针对标准强化学习通常忽略生物智能体感知、注意力和工作记忆等认知计算成本的问题,该研究探讨了有限理性条件下的强化学习建模。作者推导并提出了 MI-SARSA 算法,这是一种同策略时序差分强化学习算法,通过引入学习到的边际动作互信息正则化来限制策略复杂度,旨在更好地模拟受计算约束的生物智能决策行为。

阅读原文 ↗推荐理由:将认知科学中的有限理性与互信息正则化引入强化学习,提出了新的 MI-SARSA 算法架构。# 强化学习# 有限理性# MI-SARSA# 策略复杂度# 认知建模
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

大语言模型编程研究:究竟是在修复错误还是在重新编写代码?

大语言模型(LLM)已广泛应用于编程解题与缺陷修复,但现有研究通常将解题能力与修复能力独立评估,忽略了二者之间的关联。本研究重点探讨LLM在修复含错代码时相较于人类补丁的偏差程度,并验证模型是否存在倾向于直接生成全新解法而非局部修复的偏差。为此,研究团队构建了包含约3000次编程提交的数据集,系统分析模型修复缺陷的实际机制。

阅读原文 ↗推荐理由:通过实证分析揭示了代码大模型在程序修复中倾向重构还是修补的行为特征,对代码模型评估具启发意义。# 大模型# AI编程# 程序修复# 经验研究# 软件工程
arXiv 机器学习✦ 精选AI 评分 65/10012:00

小波扩散模型在降水降尺度中的跨区域泛化能力评估

本研究基于小波扩散模型(WDM)框架,系统评估了扩散模型在公里级降水降尺度任务中的跨区域与跨事件泛化能力。研究覆盖了代表对流、冬季、热带及大气河流等降水机制的美国六个区域,通过对NOAA多雷达/多传感器复合反射率场进行块平均生成低分辨率输入。研究重点测试了仅在俄克拉荷马州样本上训练的模型向其他未知地理区域和天气形态迁移的实际表现。

阅读原文 ↗推荐理由:该研究系统评估了基于小波扩散模型的AI气象降水降尺度方法在跨区域泛化上的表现与局限。# 扩散模型# 小波扩散模型# 降水降尺度# AI气象# 泛化能力
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CounterRoute:基于分层反事实信用分配的自路由推理强化学习框架

针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。

阅读原文 ↗推荐理由:提出了一种优化大模型推理算力浪费的自路由强化学习新框架,具有较高的前沿研究价值。# 大模型# 强化学习# 思维链# 算力# 推理
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

流式全双工语音模型中的主动附和反馈控制研究

该研究针对全双工语音对话模型缺乏显式自然附和(如“嗯”、“对”等应答词)的问题,提出了一种轻量级预测头结构。该机制直接利用全双工模型自身的隐藏状态来预测附和时机,当概率超过设定阈值时即强制解码生成反馈。实验在7B规模的PersonaPlex和1B规模的F-Actor模型上验证了该方法的跨尺度泛化能力,探针分析也证实其隐藏状态能够有效契合人类真实的交谈节奏。

阅读原文 ↗推荐理由:针对全双工实时语音交互的拟人化痛点,提出轻量级附和时机预测方案,有效提升了对话自然度。# 全双工对话# 语音大模型# 人机交互# Backchannel# 模型架构
arXiv 机器学习✦ 精选AI 评分 75/10012:00

增量学习机制:面向泛化科学机器学习的目标设计

在科学机器学习中,增量学习通常针对物理基线残差训练模型,传统观点认为基线越精确、残差尺度越小,下游性能就越好。该研究表明,仅靠残差尺度不足以评估目标的可学习性。通过在分子图神经网络的总能量预测任务中进行评估,研究发现复杂的局部描述符基线虽然残差绝对尺度更小,但在架构代理空间中表现得极不平滑,相对其尺度反而更难学习。论文揭示了面向泛化科学机器学习的目标设计关键机制。

阅读原文 ↗推荐理由:揭示并挑战了科学机器学习中“残差越小越容易学习”的直觉认知,为AI4Science模型目标设计提供了理论指导。# 科学机器学习# 增量学习# 图神经网络# AI for Science# 模型泛化
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

Rufus-Air:基于GLM-4.5-Air的开源大模型后训练完整方案

该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。

阅读原文 ↗推荐理由:开源了包含八个阶段的大语言模型后训练完整工作流与奖励设计,对模型后训练实践具有较高参考价值。# 大模型# 后训练# 强化学习# GLM# 开源
arXiv 人工智能✦ 精选AI 评分 65/10012:00

硬预算重复评测中真实不确定性的理论界限研究

该研究探讨了在硬预算约束下,通过重复评测来准确估计基准测试分数并确保较低不确定性的理论极限。研究在固定任务网格和响应成本限制的框架下,推导出了在完全观察与允许遗漏两种情况下,最差纯群组的最优期望区间宽度理论界限。该理论下界同样适用于自适应硬预算策略,为机器学习模型的基准评测设计与置信度验证提供了严格的理论依据。

阅读原文 ↗推荐理由:推导了大模型基准评测在硬预算约束下的不确定性理论极限,为评测协议设计提供了理论指导。# 评测# 不确定性量化# 理论下界
arXiv 机器学习AI 评分 45/10012:00

针对多链鲁棒平均奖励MDP的向量贝尔曼理论研究

该研究针对存在不确定性的长期性能优化问题,探讨了多链鲁棒平均奖励马尔可夫决策过程(MDP)。在此类问题中,最优长期奖励通常依赖于初始状态,需要建立兼顾递归类奖励和转移不确定性的向量贝尔曼理论。论文针对具有紧凑、动作后(s,a)-矩形模糊集的有限模型构建了该理论,提出了“增益优先、偏差第二”的优化原则,导出了耦合的向量增益-偏差系统,用于求解最优鲁棒增益。

阅读原文 ↗推荐理由:强化学习与控制理论的前沿基础研究,拓展了多链鲁棒MDP的理论求解框架。# 强化学习# 马尔可夫决策过程# 贝尔曼方程# 鲁棒优化# 理论研究
arXiv 机器学习✦ 精选AI 评分 72/10012:00

面向机制可解释性的流递归模型(SRM)

该研究针对机制可解释性技术难以随大语言模型规模与深度扩展的问题,提出了一种新型架构——流递归模型(SRM)。SRM 是对分层推理模型(HRM)的改进,通过将计算过程组织为多个相互交互的潜在流,在保持模型可扩展性的同时暴露其内部计算结构。该工作旨在通过设计天然具备可解释性结构的小型模型,为验证和理解模型内部行为提供新的探索路径。

阅读原文 ↗推荐理由:提出了一种面向机制可解释性的新型模型架构,通过多潜在流交互设计探索可扩展与透明性并存的路径。# 模型架构# 可解释性# SRM# 前沿研究# 大模型
arXiv 机器学习✦ 精选AI 评分 65/10012:00

无监督学习何时成败?基于子空间视角的重构异常检测几何分析

该研究探讨了基于重构的无监督异常检测在模型过度拟合异常或丢失正常变异时的失败机理。论文借助“子空间追求”(PoS)假说,从交集、并集和联接几何视角对失败模式进行理论表征:模型容量过大易引发联接盲区,容量不足则会导致交集偏好与正常保真度下降。研究证明紧凑的正常数据并集是最优保真范围,通常依赖非线性重构映射实现。

阅读原文 ↗推荐理由:从几何与子空间理论角度系统解析了重构型无监督异常检测的成败机理,具有扎实的理论分析价值。# 无监督学习# 异常检测# 子空间假说# 重构误差# 前沿研究
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LastOPD:解决隐状态同策略大模型蒸馏中的后期崩溃问题

该研究针对大模型同策略蒸馏(OPD)缺乏教师模型隐层思考过程的问题展开探索。尽管引入隐状态监督(Latent supervision)能对齐学生与教师模型的内部状态,但在将Qwen3-4B/8B蒸馏至Qwen3-1.7B-Base的实验中,研究人员发现该方法存在“早期增益、后期崩溃”的失效现象,MATH-500准确率虽迅速提升但随后崩溃。为此,论文提出了LastOPD方法以抑制此类崩溃。

阅读原文 ↗推荐理由:针对大语言模型同策略隐层蒸馏中性能崩溃问题提出解决方案,对模型轻量化与对齐训练具有参考价值。# 蒸馏# Qwen3# 大模型# 前沿研究
arXiv 机器学习✦ 精选AI 评分 68/10012:00

图像保真度不等同于场保真度:神经断层扫描中的热力学联合重建与误差定位

该论文针对科学断层扫描中神经场优化的核心难题展开研究。作者指出,由于2D到3D的正向映射为多对一关系,较低的2D图像误差并不能保证隐式3D物理场的准确性,且该隐式场在训练中缺乏直接监督。为此,研究团队提出了CoroNeRF框架,利用可微原子发射渲染器,直接从多视角、多谱线辐射强度中联合优化3D电子密度与温度场,并在日冕断层扫描场景中进行了测试与验证(注:原摘要结尾处有所截断)。

阅读原文 ↗推荐理由:探索了神经场技术在科学计算与3D物理场重构中的前沿应用,对解决多对一病态重构问题具有理论参考价值。# 神经场# NeRF# 断层扫描# 3D重建# AI for Science
arXiv 机器学习✦ 精选AI 评分 68/10012:00

基于电子先验与响应态学习的可迁移振动光谱表征研究

针对振动光谱预测在跨化学空间场景下易受局部立体电子环境扰动而导致精度下降的问题,研究提出 SO(3) 等变神经卡尔曼网络(SENK)。该框架构建了响应态级联结构,融合了用于学习 Hessian 矩阵、偶极导数及极化率导数的等变 Transformer 骨干网络,通过等变神经卡尔曼桥实现状态依赖精炼与可靠性感知,并结合 NBO 电子先验以提升光谱表征的可迁移性。

阅读原文 ↗推荐理由:提出结合电子先验与等变神经网络的新架构,解决了分子振动光谱预测中的跨空间迁移与精度难题。# AI for Science# 等变神经网络# Transformer# 光谱预测# 分子表征
arXiv 机器学习✦ 精选AI 评分 70/10012:00

基于埃尔米特多项式的谱图神经网络架构 HermNet 研究

该研究深入探讨了基于埃尔米特多项式构建的谱图神经网络,并提出了 HermNet 模型。该模型将节点级预测器与归一化埃尔米特传播相结合,依靠稀疏递推关系实现计算,既无需昂贵的特征值分解也不依赖可学习基底。研究还评估了坐标校准、响应归一化和高斯导数正则化等可选机制,并系统分析了在有限训练预算下,不同完备多项式基底在优化行为上的差异。

阅读原文 ↗推荐理由:提出了一种基于埃尔米特多项式且无需特征分解的高效谱图神经网络新架构 HermNet。# 图神经网络# HermNet# 谱图理论# 多项式基底# 模型架构
arXiv 机器学习✦ 精选AI 评分 68/10012:00

基于lp正则化的大语言模型LoRA自动秩分配方法

低秩适应(LoRA)已成为大语言模型中广泛应用的参数高效微调方法,但如何确定各适应矩阵的秩仍是核心挑战。针对现有自适应秩分配方法多依赖人工设计重要性评分的问题,该研究提出了lp-LoRA方法。该方法基于信号处理中经典的稀疏诱导技术,利用0

阅读原文 ↗推荐理由:提出了一种基于lp正则化的LoRA自动秩分配新方案,改进了大模型参数高效微调的优化理论与实现。# 大模型# LoRA# 微调# 模型架构# 稀疏正则化
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:14

科大讯飞发布全国产算力训练语音识别大模型Spark-ASR-2.0

科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,该模型依托语音基座大模型Spark-Audio-1.0-Preview构建。新版本在方言免切换识别、嘈杂环境应对、上下文纠错以及口语书面化规范等方面实现显著提升,同时整体推理成本较上一代仅增加10%。目前,该模型已落地讯飞输入法,并通过讯飞开放平台对外提供API服务。

阅读原文 ↗推荐理由:科大讯飞基于全国产算力推出新一代语音识别大模型,在上下文理解与低成本推理上实现重要升级并已开放落地。# 科大讯飞# 语音# 算力# 大模型
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:13

盘点梁文锋署名技术论文:聚焦底层架构与核心算子创新

该文梳理了梁文锋在学术论文中的署名脉络。过去三年中,梁文锋极少作为第一作者或通讯作者出现在动辄上百人署名的旗舰模型整体报告中,而是将研究精力与署名重点投向最底层的原子技术,包括MLA注意力机制、MoE路由机制、mHC拓扑流形、DSpark推理算子以及DSec智能体沙盒等关键底层技术论文,展现了其对AI基础架构研发的深耕。

阅读原文 ↗推荐理由:梳理了梁文锋在MLA、MoE路由等关键底层模型架构与算子上的核心技术论文贡献。# 模型架构# MLA# MoE# 芯片
AITNT · AI头条(网页)✦ 精选AI 评分 78/10010:11

GLM-5.3-Flash融合Kimi与DeepSeek注意力架构,大模型设计走向混合组合

GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。

阅读原文 ↗推荐理由:体现了大模型底层注意力机制从单一路线竞争向异构融合设计演进的重要技术趋势。# GLM# DeepSeek# Kimi# 注意力机制# 模型架构
AITNT · AI头条(网页)✦ 精选AI 评分 72/10010:07

北大等团队开源强化学习数据策略框架DataFlex-RL,简化模型后训练对比

随着推理模型和可验证奖励强化学习(RLVR)在后训练中的重要性日益凸显,大模型训练中的数据策略安排变得愈发关键。为此,北大DCAI团队联合中国科学院大学、上海算法创新研究院以及中关村学院开源发布了DataFlex-RL。该框架旨在解决强化学习后训练中数据策略接入繁琐及效果对比不公平等痛点,为模型训练策略的标准化与高效评测提供支持。

阅读原文 ↗推荐理由:北大联合多家机构开源针对大模型强化学习后训练的数据策略框架,提升了后训练研究的对比规范与工程效率。# 强化学习# 大模型# 开源# 北京大学# 后训练
IT之家 · AI 筛选✦ 精选AI 评分 83/10008:04

传OpenAI即日预览网络安全专用模型GPT-6 Cyber

据外媒报道,OpenAI计划在未来数日内预览其最新的网络安全专用模型GPT-6 Cyber,并推出配套产品以协助客户实现安全、自动化的部署。该模型预计将在9月29日的旧金山开发者大会或更早亮相,系OpenAI今年发布的第四款网络安全模型,目前已向部分Daybreak Red内测客户开放Alpha权限。此外,大会期间预计还将密集公布十余款面向企业与消费端的新产品。

阅读原文 ↗推荐理由:OpenAI首度冠以GPT-6命名的专用大模型传闻曝光,展现其在垂直安全领域的最新技术布局。# OpenAI# GPT-6# 安全# 大模型# 开发者大会
Transluce 研究(网页)✦ 精选AI 评分 82/100收录 07:49

将“激活神谕”技术扩展至万亿参数模型:深入内部表征监测AI异常行为

针对奖励作弊(Reward Hacking)及评测感知等难以仅凭输出内容发现的AI异常行为,研究人员构建了“激活神谕”(Activation Oracles)系统。该系统作为辅助AI,专门分析目标模型的内部激活状态以检测和预测其潜在行为。研究团队成功将这一神谕训练机制扩展到了万亿参数模型上,并验证了其检测性能会随模型体量与数据规模的增长而持续提升(原文摘要在数据规模处截断)。

阅读原文 ↗推荐理由:展示了通过分析大模型内部激活状态来监测隐藏风险的技术路线,并首次成功扩展至万亿参数级别。# 大模型# 可解释性# 安全# 对齐# 万亿参数
Claude 官方博客(网页)✦ 精选AI 评分 88/100收录 07:49

针对长上下文编程优化,Claude Opus 5.5 正式发布

针对当前开发者编程会话时间更长、上下文使用量更大的趋势,Anthropic 推出最新的 Claude Opus 5.5 模型。该模型不仅在训练层面专门针对长上下文编程场景进行了优化,还在定价机制上做出调整,旨在帮助开发者在应对复杂代码任务时有效控制并优化使用成本。

阅读原文 ↗推荐理由:Claude Opus 系列重磅更新,针对现代高上下文编程场景优化了模型表现与使用成本。# Claude# Anthropic# 代码大模型# 长上下文# AI编程