AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 75/10009月24日 12:00

引导与动作的相互强化:多模态网页智能体离线评测基准 WebMRE

针对网页智能体在实时环境中评估存在状态漂移、难以稳定复现和开展可控训练研究的痛点,研究团队提出了离线评估基准 WebMRE。该基准基于 WebArena 的成功轨迹构建,包含 541 个任务和 5,293 个步骤,配备经过全面审计的测试标签和确定性评估协议,无需运行环境即可确保同一检查点在多次运行中输出一致评分。每个步骤将人类指导语句与具体动作配对,首次实现了对引导与动作相互强化机制的离线研究。

推荐理由提出了无需实时环境的确定性离线基准,有效解决了网页智能体评测难以复现和量化的核心痛点。

原标题:Guides That Cause Actions: An Offline Study of Guide-Action Mutual Reinforcement in Multimodal Web Agents

阅读 arXiv 自然语言处理 原文 ↗