AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 65/10012:00

针对生成式搜索的主张门控来源风险审计机制

该研究针对生成式搜索中答案虽有引用却可能遗漏改变语义解释的源关系这一问题,提出了一种主张门控审计规范。该机制对“查询-来源-答案”三元组进行审计,仅在关系证据、答案采纳、实质性与披露四项要素均被观测时判定存在遗漏,避免将证据不全误判为独立无关。该规范将判定结果绑定至带版本控制的证据片段,并通过引用检查器使审计记录契约可执行,提升了生成式搜索溯源审计的可靠性。

阅读原文 ↗推荐理由:提出了一种针对生成式搜索中引用溯源风险的形式化审计机制,有助于提升AI搜索结果的可信度与合规治理。# 生成式搜索# 安全# 溯源审计# 事实性检验# 信息检索
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 72/10012:00

ZeroGate:面向受治理AI智能体运行时的信任保留快速路径机制

针对AI智能体提前授权可能导致载荷、权限或状态发生漂移的安全风险,研究团队提出ZeroGate架构。该方案将精确操作审批与持久本地准入解耦:签发者签署具有时效性的ActionPass凭证,受信任运行时适配器重构最终操作,再由本地网关验证绑定并消耗nonce。系统利用SQLite事务同步处理nonce注销、配额更新及准入收据生成,在维持信任边界和决策一致性的前提下优化了执行分发延迟。

阅读原文 ↗推荐理由:针对AI智能体运行时的安全管控与执行延迟平衡,提出了解耦审批与准入的实用工程架构。# 智能体# 运行时架构# 安全鉴权# 安全# 访问控制
arXiv 人工智能✦ 精选AI 评分 75/10012:00

RAG-NAROK:面向检索增强生成的检索感知型知识库投毒攻击

针对检索增强生成(RAG)系统的安全漏洞,该研究指出当前架构对动态检索流水线的依赖带来了新型对抗风险。现有知识库投毒攻击大多采用静态预设注入,未考虑受害系统在面对具体查询时的实际检索内容。为此,论文探索了具有检索感知的投毒机制,分析攻击者如何利用特定源反驳等手段在竞争性检索环境中提升攻击效果,揭示了RAG系统潜在的安全隐患。

阅读原文 ↗推荐理由:揭示了RAG系统在动态检索环境下易受感知型投毒攻击的新型安全脆弱性。# RAG# 知识库投毒# 安全# 对抗攻击# 大模型
arXiv 人工智能✦ 精选AI 评分 75/10012:00

评估代码智能体内核漏洞利用能力:安全评测基准 KEX-bench 发布

尽管代码智能体现已能在生产软件中发现实际漏洞,但漏洞挖掘成果并不等同于构建漏洞利用原语的能力。为此,研究团队推出了用于评估代码智能体针对真实操作系统内核生成利用原语的基准 KEX-bench。该基准涵盖 40 个 Linux 与 Windows 真实 CVE 的 45 个任务实例,涉及内核地址泄露、指令指针控制和任意地址读写等场景,并在隔离虚拟机环境中借助确定性验证器评估智能体的利用能力。

阅读原文 ↗推荐理由:首个专门评估代码智能体在真实操作系统内核中构建漏洞利用原语的安全基准,对前沿 AI 攻防能力边界评估具有重要参考价值。# 安全# 代码智能体# 漏洞利用# 评测
arXiv 人工智能✦ 精选AI 评分 75/10012:00

对齐惯性研究:评估模型策略干预对先验训练行为的覆盖耐久度

针对平台运营商依赖系统提示词和微调来规范模型行为但可靠性存疑的问题,该研究提出了覆盖成功率(OSR)和“对齐惯性”概念,用于量化后验干预能否有效覆盖先验训练习得的行为。研究在医疗虚假信息和仇恨言论场景下,对 Llama 和 Mistral 模型测试了零样本提示与 LoRA 微调效果。结果显示对齐惯性普遍存在,且其表现因模型架构、应用领域及策略导向的不同而存在显著差异。

阅读原文 ↗推荐理由:该研究系统量化了模型安全策略覆盖先验训练行为的局限性,为大模型安全治理与对齐评估提供了新视角。# 安全# 对齐# 对齐惯性# 大模型# 微调治理
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CART:面向大语言模型的闭环自适应红队测试框架

针对传统自动化红队测试依赖固定提示词、无法根据测试反馈动态调整的问题,研究人员提出了CART闭环自适应红队测试框架。该框架能够利用前序测试结果动态引导后续测试方向,在初始广泛覆盖风险的基础上,深入追踪暴露的脆弱点并保持探测多样性。CART解耦了测试挑战者、被测目标(支持纯文本模型及工具调用智能体)与评估裁判三类角色,实现了更高效动态的大模型安全风险探测。

阅读原文 ↗推荐理由:提出了一种闭环自适应红队测试框架,有效解决了传统大模型安全评估难以根据暴露漏洞动态调整测试策略的局限。# 大模型# 红队测试# 安全# 安全评估# 智能体