AI 推理的经济学:测试时计算的成本与收益权衡
推理能力显著提升了 AI 的准确率,但也带来了高昂的计算成本。文章深入探讨了测试时计算(test-time compute)、智能体运行性能与响应速度之间的权衡关系,并分析了模型在特定场景下过度“思考”可能适得其反的经济与性能代价,为优化推理阶段的资源投入提供参考思路。
推理能力显著提升了 AI 的准确率,但也带来了高昂的计算成本。文章深入探讨了测试时计算(test-time compute)、智能体运行性能与响应速度之间的权衡关系,并分析了模型在特定场景下过度“思考”可能适得其反的经济与性能代价,为优化推理阶段的资源投入提供参考思路。
扩散语言模型通过迭代去噪生成文本。研究团队发现该类模型中存在一种“稳定但错误锁定”的推理故障,即答案在去噪阶段早期便过早稳定于错误结果。置信度、熵等常规表层解码信号难以有效区分正误锁定。为此,论文将选择性推理修复建模为轻量级测试时规划任务,并提出了 LOCKR,一种基于隐状态轨迹引导的规划器,专门用于检测与修复该问题。