AdvRole:面向角色扮演智能体的对抗性闭环课程学习框架
基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。
基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。
该研究揭示了大语言模型智能体在处理客户关系管理(CRM)记录时的一种新型失效模式:上下文锚定易受利益相关方偏见误导。在销售线索资质审核等业务中,当输入上下文中包含具有主观乐观动机的销售代表断言时,模型往往会将其视为客观证据采纳,进而批准企业客观记录原本判定为不合格的交易。基于CRMArena-Pro基准的测试表明,即便采用更强大的模型,也难以有效规避这种将说服性言辞误当事实的缺陷。
针对交互式AI构建与评测中模拟用户难以复现真实意图演变和交互结果的缺陷,研究人员提出了多轮用户模拟器 TRACER。该模型能够显式建模用户动态演变的意图,使模拟行为与真实交互轨迹保持一致。TRACER 采用两阶段训练策略:首先在真实用户对话上进行监督微调(SFT),随后利用融合了分层结果与轨迹奖励的多轮强化学习进行对齐训练,从而大幅提升用户模拟的真实度与行为一致性。
针对大语言模型智能体在调用科学软件时可靠性不足的问题,研究人员推出了 Epydemix Agent 框架。该框架建立在开源随机区室流行病学建模 Python 库 Epydemix 之上,为 AI 智能体提供四大核心能力:模型与参数发现、声明式场景规范的预防性验证、通过经过测试的库代码进行执行,以及结果的可检查性,从而实现了高可靠性的自然语言驱动科学建模。
扫描电子显微镜(SEM)常用于表征结构钢因氢脆引起的微观结构变化。尽管机器学习能自动化此类表征,但现有模型常采用图像级划分,当同一样本区域包含多张图像时易引发数据泄漏。为此,研究人员针对316L不锈钢原始状态与充氢状态的SEM显微图像分类任务,提出了一种基于14个空间区域留一(LORO)交叉验证的区域保留评估协议,以实现对纹理特征与深度特征更可靠的无泄漏评估。
针对大语言模型智能体在接入海量企业工具时面临的上下文超限、工具选择退化及合规治理漏洞等问题,研究人员提出了名为 skilder 的新框架。传统通过提示词设定的安全策略缺乏硬性约束,而多智能体委托方案又分散了审计日志。skilder 将技能与工具等能力打包为特定角色,通过基于角色的范围划分与渐进式技能发现机制,实现对智能体工具调用的结构化治理与确定性访问控制。
针对现有大语言模型交易系统多侧重长期预测或缺乏状态记忆等缺陷,研究人员提出了记忆增强型交易智能体框架 META。该框架是首个引入类似检索增强生成(RAG)的情景记忆增强型多智能体金融决策系统,通过整合一系列专门的指标分析智能体,有效解决了复杂交易环境下的动态决策需求,提升了智能体在金融分析与交易推理中的实际应用能力。
该研究提出了名为RECLAIM的新基准测试,旨在评估AI智能体能否复现机器学习论文的核心研究结论。基准选取了100篇NeurIPS 2025论文,预先设定了待复现结果、成功复现判定标准以及GPU运行时间预算。根据原作者开源内容的完整度,基准设立了不同难度层级,测试智能体在软件安装、代码调试及运行实验等完整科研工作流中的自动化复现能力。
研究人员推出了名为Forecast-Dojo的可回放环境,专门用于基准测试和训练大语言模型预测智能体。该环境将已公布结果的预测市场问题与带时间戳的历史新闻相结合,允许智能体在连续的历史时间节点检索事件并动态调整预测,无需等待未来事件即可完成评估、交互数据收集与结果反馈。系统包含1568个Polymarket事件及1880万篇带日期的新闻文章,并对12个模型进行了评估测试。
随着企业内AI编程智能体从数百人试点规模扩展至数万人,企业多直接采购Claude Code或Codex等第三方运行框架。此类框架负责决策模型路由、上下文读取、Prompt缓存使用及子智能体调用,直接决定了算力消费单价与调用总量。报告指出,企业若直接使用未加调优的专有或默认框架,将面临高昂且失控的调用成本,亟需加强路由与治理管控。
词汇借用是词典编纂和语料库语言学等数据密集型领域的重要研究课题,但现有标准文本处理工具库普遍缺乏该功能。本文推出了开源 Python 软件包 pylazaro,专注于从西班牙语文本中自动提取未同化的词汇借词(主要是英语借词)。该工具包整合了基于不同算法库训练的五个序列标注模型,并提供统一的调用接口,方便研究人员开展针对性的外来词检测与文本挖掘任务。
针对工具调用型智能体在策略持续更新中动作归因(Action Credit)失效、重新计算导致昂贵工具调用与环境交互成本的问题,该研究探讨了历史归因何时真正需要更新。研究核心发现,动作价值的变化并不一定会导致最终决策的改变;只要策略诱导的漂移不足以颠覆原有决策,历史动作归因即可继续复用,从而大幅降低计算开销。(注:原始摘要文本存在部分截断)
基于大语言模型的多智能体系统虽能自动化挖掘量化阿尔法因子,但依赖外部API带来了成本、可用性及保密性挑战,且长期运行易导致研究路径坍塌。为此,研究团队提出 AlphaDiverse 框架,整合了多智能体研究系统、多样化研究路径收集以及本地智能体后训练流程。该框架通过生成互补的研究方案组合并动态调整研究环境,旨在提升本地量化研究智能体在因子挖掘中的多样性探索能力。
在去中心化的大语言模型多智能体系统中,单个智能体可能在保持响应的同时任务求解质量持续退化,引发灰度失效。针对此类问题,研究人员提出了完全去中心化的自愈框架MeshHeal。该框架在双时间尺度上结合能力匹配的同行评审机制:在快速时间尺度上,通过自适应分层机制升级不确定或低评分输出的评审层级;在提供即时任务保护的同时,收集证据以动态调整未来的路由决策,并允许恢复正常的智能体重新接入。
科技与创新政策对国家竞争力至关重要,但其多样性与庞大规模使得系统化监测变得极其困难,传统人工调查成本高昂且难以跨国扩展。本研究探索了利用大语言模型从非结构化长政策文本中提取信息的能力,提出将大模型作为“AI受访者”以生成结构化调查响应。研究团队开发了基于长上下文的数据提取流程,用于自动化政策分析与追踪,显著降低了人工监测成本。
该研究提出了LabFactory框架,旨在将科学任务需求自动转化为可执行的AI实验室。在该框架中,AI构建器根据科学任务简报,构建并打包一套集成特定模型、知识资源、实用工具和控制器的定制求解系统。整个开发和打包过程在受计量的独立工作区中完成,随后交付给独立宿主环境执行,探索了科学计算与AI系统的自动化端到端构建路径。
针对癌症登记员及肿瘤数据专家需处理复杂且频繁更新的编码和分期标准这一痛点,研究团队开发了CRISS(癌症登记智能支持系统)。该系统采用检索增强生成(RAG)架构,构建能够快速提供引文支持的对话助手。研究评估了CRISS在提供准确且附带引用来源的解答、改善指南检索与解读、以及在保持人工最终审核的前提下支持人员培训和技术咨询等方面的实际效果。
该研究针对欧洲电力交易跨日前、日内和平衡等多层级市场的复杂机制,提出了一种符合监管约束的AI辅助交易系统功能架构。该架构深度结合了欧盟市场耦合机制、跨区域电力传输物理约束,并满足REMIT、MiFID II、MiFIR和EMIR等合规要求。研究通过定义决策状态向量、残差风险敞口核算以及约束优化目标,构建了一套正规化的系统规范,为高监管环境下的电力AI交易系统开发提供了工程指导。
针对自动语音识别(ASR)在处理长音频时难以准确、一致转录专业术语的问题,研究人员提出了基于大语言模型的智能体 Agentic-GER。该系统利用完整转录文本的全局上下文与世界知识,识别可疑术语并化解歧义假设;同时通过选择性重新转录原始语音来核验候选修正结果,显著提升了长语音中领域专业术语的识别准确率与一致性。
该研究探讨了大语言模型智能体的持久记忆机制,旨在不更新权重的前提下持续改进提示与技能。研究发现,将检索范围与认证范围精确匹配,能有效防止跨任务族的干扰,支持在重复出现的任务族中实现可靠适应。研究人员在12轮代码修复数据流ProcStream-RSI上对冻结模型智能体进行了测试,并使用基于执行的正交回归控制门控机制,证实仅在技能生成的原始任务族内检索该技能,可显著提升轨迹效用。
本研究探讨利用分布式声波传感(DAS)与深度学习技术进行高时空分辨率城市交通动态监测。DAS通过复用现有的地下光纤电缆作为密集连续的传感器阵列,能够以米级空间分辨率和秒级时间分辨率对道路交通活动进行被动且保护隐私的实时监测。该研究旨在验证DAS结合深度学习在智慧交通感知中的有效性(注:原文摘要信息有所截断,具体实验指标未详述)。
深度搜索要求大语言模型智能体分解复杂查询、检索证据并合成可靠答案。然而现有的 ReAct 架构智能体存在角色耦合(单策略兼顾规划、证据利用与合成)以及搜索历史累积导致上下文噪声增加的问题。为此,研究团队提出 IterSynth 范式,通过角色解耦与基于摘要的状态演进机制,在负责识别信息需求的规划器与负责整合证据的合成器之间交替执行,有效改善了深度搜索智能体的长程推理与信息合成能力。
该研究针对大语言模型智能体在复杂工具使用任务中的技能自我进化问题展开探索。论文指出,复杂任务通常存在多种有效解题路径,失败轨迹往往也包含前期的有效进展而非全盘皆错。因此,研究提出不应将失败轨迹强行与固定成功路径对齐或进行粗粒度反思,而应精确定位有效求解向错误偏离的转折点,通过偏差引导的方式实现智能体技能的高效自我进化与演进。
该项目发布了题为“构建拥有1万名AI研究人员的城市”的研究或实验展示(lab.cloud/society)。当前提供的信息有限,主要展示了一个大规模多智能体协作或AI研究人员模拟社会系统的实验探索,具体技术细节与实验结果需参考原链接。
开源项目 LLMSearchRecommender 聚焦于将大语言模型(LLM)与现代人工智能技术应用于搜索与推荐系统。该项目在 GitHub 上开源,旨在探索和整合 AI 驱动的信息检索与个性化推荐工程实践。由于原始分享仅提供了代码仓库链接,具体的技术架构、功能特性和实现细节仍需参考该项目的最新文档。
该文章讨论了如何利用人工智能工具协助和参与开源软件项目的开发与贡献。由于输入信息仅包含文章标题和链接,具体的方法、实践案例及详细观点暂未披露。
深度求索(DeepSeek AI)旗下智能体运行时框架 DeepSeek Harness 悄然上线官方桌面版开发者预览,版本号为 V0.1.7-rc.2。该桌面版免去了此前安装 Node.js 及终端运行的繁琐步骤,目前已支持 Windows x64 和 macOS Apple Silicon。应用内置标准模式、PTC 模式、极简模式和创造模式四种模式,支持智能体代码处理、批量调用工具和对话定制插件等功能。
llama-server 发布 v0.40.0-rc0 候选版本,着手准备移除历史兼容补丁。该版本引入了清单列表存储机制,支持在同一标签下共存针对特定运行时的清单配置,CLI 工具也全面支持基于 runner 和摘要的选择与传输。新版还为旧版 Ollama GGUF 模型增加了向 llama.cpp 兼容格式的惰性本地迁移能力,完整保留模板、投射器及 MTP 等元数据,并同步扩展了创建与导入路径。
该内容源自 QCon 上海的技术分享,探讨当前兴起的“Vibe Coding”(氛围编码/AI 辅助编程)概念在落地企业级真实工程环境时所面临的挑战与实践路径,旨在寻求 AI 提升研发效能的可靠方案。由于原始输入仅提供标题且缺乏详细正文信息,具体的技术实现细节、案例与核心结论尚不充分。
OpenAI宣布为ChatGPT Voice上线语音执行任务功能,通过接入模型与插件体系,用户可直接通过语音指令查验邮件、制作PPT、搭建网站及追回重复扣费等。该项能力已深度整合进此前推出的ChatGPT Work Agent中,新版本应用已同步面向全球用户推送,标志着语音交互进一步向具备实际操作能力的智能体演进。