AIDC
← 返回全部动态
arXiv 人工智能AI 评分 72/10009月24日 12:00

MolDesignBench:面向真实场景分子设计任务的LLM智能体评估基准

真实环境下的分子设计对大语言模型智能体提出了极高要求,需要其理解复杂上下文、满足多重约束并进行多步工具推理。针对现有基准偏向狭窄约束和单一路径的问题,研究人员提出了MolDesignBench。该基准紧密贴合实际分子设计场景,可系统评估工具增强型LLM智能体在处理多约束、不可行规范识别及多步工具调用下的综合推理与设计能力。

推荐理由针对AI4Science与LLM智能体落地场景,构建了更贴近真实复杂分子设计需求的评测基准。

原标题:MolDesignBench: Evaluating LLM-based Agent for Scenario-grounded Molecular Design

阅读 arXiv 人工智能 原文 ↗