将“激活神谕”技术扩展至万亿参数模型:深入内部表征监测AI异常行为
针对奖励作弊(Reward Hacking)及评测感知等难以仅凭输出内容发现的AI异常行为,研究人员构建了“激活神谕”(Activation Oracles)系统。该系统作为辅助AI,专门分析目标模型的内部激活状态以检测和预测其潜在行为。研究团队成功将这一神谕训练机制扩展到了万亿参数模型上,并验证了其检测性能会随模型体量与数据规模的增长而持续提升(原文摘要在数据规模处截断)。
推荐理由展示了通过分析大模型内部激活状态来监测隐藏风险的技术路线,并首次成功扩展至万亿参数级别。
原标题:Scaling Activation Oracles to Trillion-Parameter Models
阅读 Transluce 研究(网页) 原文 ↗