AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LabFactory:构建与评估可执行AI实验室的全新框架

该研究提出了LabFactory框架,旨在将科学任务需求自动转化为可执行的AI实验室。在该框架中,AI构建器根据科学任务简报,构建并打包一套集成特定模型、知识资源、实用工具和控制器的定制求解系统。整个开发和打包过程在受计量的独立工作区中完成,随后交付给独立宿主环境执行,探索了科学计算与AI系统的自动化端到端构建路径。

阅读原文 ↗推荐理由:提出了一种由AI自主构建、打包并执行特定科学任务求解系统的智能体工程框架。# LabFactory# 智能体# 科学智能# 自动化系统
9月24日2026-09-24
arXiv 机器学习✦ 精选AI 评分 78/10012:00

终端基准测试何以称“难”?研究揭示智能体评测中的“真假难度”陷阱

前沿基准测试常依赖当前模型无法解决的任务来衡量能力边界,但零通过率并不等同于真正的高难度。该研究指出,任务全军覆没既可能源于真实的能力代差,也可能是由缺失上下文、损坏的参考方案或基础设施故障等“虚假难度”导致。基于 Terminal-Bench 3 等基准中涵盖 639 个任务、2.8 万余次试验及逾 10 万美元开销的真实记录,研究系统性厘清了导致智能体任务失败的本质原因,为评测体系纠偏。

阅读原文 ↗推荐理由:通过大规模实证分析揭示了智能体基准评测中零通过率背后的工程与设计缺陷,对规范 Agent 评估体系具有重要参考意义。# 智能体# 评测# Terminal-Bench# Agent评测# 大模型
arXiv 机器学习✦ 精选AI 评分 68/10012:00

资源高效的分布式递归高斯过程算法研究

针对多智能体系统中去中心化环境下统一模型维护的难题,本文提出了两种用于多输出高斯过程回归的高效分布式递归高斯过程算法:ADMM-RGP与PDMM-RGP。该研究解决了多智能体在仅依赖本地测量和邻居通信时的高效协同计算问题,能够在量化预测不确定性的同时降低通信与计算开销,为多智能体系统的分布式学习与状态估计提供了新的理论与算法支持。

阅读原文 ↗推荐理由:针对多智能体去中心化场景提出了两套资源高效的分布式递归高斯过程回归算法。# 高斯过程# 分布式学习# 智能体# ADMM# 机器学习
arXiv 机器学习✦ 精选AI 评分 70/10012:00

ChipMEM:面向电子设计自动化智能体的基于验证记忆机制

基于大语言模型的智能体可利用电子设计自动化(EDA)工具,根据综合与验证反馈生成并修正寄存器传输级(RTL)设计。然而,现有方法通常在产生经验的同一任务上评估提炼的技能或奖励模型,容易诱发针对特定任务的反复修改,而非沉淀出可迁移的复用知识。为此,论文提出了名为 ChipMEM 的基于验证的记忆机制(注:输入摘要在介绍 ChipMEM 具体细节处被截断)。

阅读原文 ↗推荐理由:针对芯片设计自动化智能体中反馈难以迁移为复用经验的痛点,提出了新的记忆架构思路。# EDA# 大模型# 智能体# 芯片设计# RTL
arXiv 机器学习✦ 精选AI 评分 72/10012:00

CELLAUDIT:用于审查智能体发现细胞模型中输入有效性的审计框架

针对 AI 虚拟细胞模型在预测生物干预响应时可能并未真正利用输入信息的“预测-主张差距”,研究团队提出了审计框架 CELLAUDIT。在大模型智能体自动发现和迭代预测模型的场景下,CELLAUDIT 从源码计算路径、拟合依赖性以及实际预测贡献三个维度切入,系统性验证模型对输入扰动信息的使用主张是否属实,以确保智能体生成的科学预测模型具备真正的因果有效性和可靠性。

阅读原文 ↗推荐理由:针对智能体自动发现科学模型中的可信度与虚假相关问题,提出了全流程输入审查的新方法。# AI for Science# 智能体# 虚拟细胞# 模型审计# 可解释性