LabFactory:构建与评估可执行AI实验室的全新框架
该研究提出了LabFactory框架,旨在将科学任务需求自动转化为可执行的AI实验室。在该框架中,AI构建器根据科学任务简报,构建并打包一套集成特定模型、知识资源、实用工具和控制器的定制求解系统。整个开发和打包过程在受计量的独立工作区中完成,随后交付给独立宿主环境执行,探索了科学计算与AI系统的自动化端到端构建路径。
该研究提出了LabFactory框架,旨在将科学任务需求自动转化为可执行的AI实验室。在该框架中,AI构建器根据科学任务简报,构建并打包一套集成特定模型、知识资源、实用工具和控制器的定制求解系统。整个开发和打包过程在受计量的独立工作区中完成,随后交付给独立宿主环境执行,探索了科学计算与AI系统的自动化端到端构建路径。
前沿基准测试常依赖当前模型无法解决的任务来衡量能力边界,但零通过率并不等同于真正的高难度。该研究指出,任务全军覆没既可能源于真实的能力代差,也可能是由缺失上下文、损坏的参考方案或基础设施故障等“虚假难度”导致。基于 Terminal-Bench 3 等基准中涵盖 639 个任务、2.8 万余次试验及逾 10 万美元开销的真实记录,研究系统性厘清了导致智能体任务失败的本质原因,为评测体系纠偏。
针对多智能体系统中去中心化环境下统一模型维护的难题,本文提出了两种用于多输出高斯过程回归的高效分布式递归高斯过程算法:ADMM-RGP与PDMM-RGP。该研究解决了多智能体在仅依赖本地测量和邻居通信时的高效协同计算问题,能够在量化预测不确定性的同时降低通信与计算开销,为多智能体系统的分布式学习与状态估计提供了新的理论与算法支持。
基于大语言模型的智能体可利用电子设计自动化(EDA)工具,根据综合与验证反馈生成并修正寄存器传输级(RTL)设计。然而,现有方法通常在产生经验的同一任务上评估提炼的技能或奖励模型,容易诱发针对特定任务的反复修改,而非沉淀出可迁移的复用知识。为此,论文提出了名为 ChipMEM 的基于验证的记忆机制(注:输入摘要在介绍 ChipMEM 具体细节处被截断)。
针对 AI 虚拟细胞模型在预测生物干预响应时可能并未真正利用输入信息的“预测-主张差距”,研究团队提出了审计框架 CELLAUDIT。在大模型智能体自动发现和迭代预测模型的场景下,CELLAUDIT 从源码计算路径、拟合依赖性以及实际预测贡献三个维度切入,系统性验证模型对输入扰动信息的使用主张是否属实,以确保智能体生成的科学预测模型具备真正的因果有效性和可靠性。