AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 65/10012:00

针对生成式搜索的主张门控来源风险审计机制

该研究针对生成式搜索中答案虽有引用却可能遗漏改变语义解释的源关系这一问题,提出了一种主张门控审计规范。该机制对“查询-来源-答案”三元组进行审计,仅在关系证据、答案采纳、实质性与披露四项要素均被观测时判定存在遗漏,避免将证据不全误判为独立无关。该规范将判定结果绑定至带版本控制的证据片段,并通过引用检查器使审计记录契约可执行,提升了生成式搜索溯源审计的可靠性。

阅读原文 ↗推荐理由:提出了一种针对生成式搜索中引用溯源风险的形式化审计机制,有助于提升AI搜索结果的可信度与合规治理。# 生成式搜索# 安全# 溯源审计# 事实性检验# 信息检索
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 75/10012:00

RAG-NAROK:面向检索增强生成的检索感知型知识库投毒攻击

针对检索增强生成(RAG)系统的安全漏洞,该研究指出当前架构对动态检索流水线的依赖带来了新型对抗风险。现有知识库投毒攻击大多采用静态预设注入,未考虑受害系统在面对具体查询时的实际检索内容。为此,论文探索了具有检索感知的投毒机制,分析攻击者如何利用特定源反驳等手段在竞争性检索环境中提升攻击效果,揭示了RAG系统潜在的安全隐患。

阅读原文 ↗推荐理由:揭示了RAG系统在动态检索环境下易受感知型投毒攻击的新型安全脆弱性。# RAG# 知识库投毒# 安全# 对抗攻击# 大模型
arXiv 人工智能AI 评分 55/10012:00

语音数据集中的性少数群体包容性:审计与实践张力分类研究

该研究审查了现有语音技术数据集中对 LGBTQIA+(酷儿)声音的包容程度,深入分析此类群体代表性缺失的根源。研究人员对6个不同的主流语音数据集进行了审计,结果显示可测量的酷儿声音占比极低(仅占发言者的0%至1.4%),远不足以用于稳健的算法偏见评估。以此群体为案例,研究提出了从边缘化群体采集语音数据时的实际挑战与张力分类法,并与其他数据集展开了对比分析。

阅读原文 ↗推荐理由:量化揭示了主流语音数据集中边缘群体数据的极度匮乏,为评估语音 AI 偏差与数据伦理治理提供了实证参考。# 语音# AI伦理# 数据集审计# 算法公平性# 数据治理
arXiv 人工智能✦ 精选AI 评分 60/10012:00

迈向参与式语音数据集构建:针对酷儿群体的案例研究与概念框架

本文提出了一种参与式语音数据集构建框架,并以LGBTQIA+(酷儿)群体为核心案例展开研究。论文指出,该群体长期面临诸如利用技术辨识性取向等潜在AI危害与伦理风险。研究深入审查了当前主流语音数据采集方式对酷儿群体的不适用性,分析了以往酷儿社群在参与式AI方面的实践经验,旨在为边缘群体语音数据的安全采集、伦理治理与包容性构建提供理论参考与框架指导。

阅读原文 ↗推荐理由:聚焦边缘群体的AI伦理与识别风险,提出了社群深度参与的语音数据治理新框架。# 语音数据集# 参与式AI# AI伦理# 数据治理# 数据收集
arXiv 人工智能✦ 精选AI 评分 75/10012:00

评估代码智能体内核漏洞利用能力:安全评测基准 KEX-bench 发布

尽管代码智能体现已能在生产软件中发现实际漏洞,但漏洞挖掘成果并不等同于构建漏洞利用原语的能力。为此,研究团队推出了用于评估代码智能体针对真实操作系统内核生成利用原语的基准 KEX-bench。该基准涵盖 40 个 Linux 与 Windows 真实 CVE 的 45 个任务实例,涉及内核地址泄露、指令指针控制和任意地址读写等场景,并在隔离虚拟机环境中借助确定性验证器评估智能体的利用能力。

阅读原文 ↗推荐理由:首个专门评估代码智能体在真实操作系统内核中构建漏洞利用原语的安全基准,对前沿 AI 攻防能力边界评估具有重要参考价值。# 安全# 代码智能体# 漏洞利用# 评测
arXiv 人工智能✦ 精选AI 评分 75/10012:00

对齐惯性研究:评估模型策略干预对先验训练行为的覆盖耐久度

针对平台运营商依赖系统提示词和微调来规范模型行为但可靠性存疑的问题,该研究提出了覆盖成功率(OSR)和“对齐惯性”概念,用于量化后验干预能否有效覆盖先验训练习得的行为。研究在医疗虚假信息和仇恨言论场景下,对 Llama 和 Mistral 模型测试了零样本提示与 LoRA 微调效果。结果显示对齐惯性普遍存在,且其表现因模型架构、应用领域及策略导向的不同而存在显著差异。

阅读原文 ↗推荐理由:该研究系统量化了模型安全策略覆盖先验训练行为的局限性,为大模型安全治理与对齐评估提供了新视角。# 安全# 对齐# 对齐惯性# 大模型# 微调治理
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CART:面向大语言模型的闭环自适应红队测试框架

针对传统自动化红队测试依赖固定提示词、无法根据测试反馈动态调整的问题,研究人员提出了CART闭环自适应红队测试框架。该框架能够利用前序测试结果动态引导后续测试方向,在初始广泛覆盖风险的基础上,深入追踪暴露的脆弱点并保持探测多样性。CART解耦了测试挑战者、被测目标(支持纯文本模型及工具调用智能体)与评估裁判三类角色,实现了更高效动态的大模型安全风险探测。

阅读原文 ↗推荐理由:提出了一种闭环自适应红队测试框架,有效解决了传统大模型安全评估难以根据暴露漏洞动态调整测试策略的局限。# 大模型# 红队测试# 安全# 安全评估# 智能体