ArGuard评测任务:聚焦阿拉伯语梗图与大模型提示词中的有害内容检测
ArGuard 是一项针对阿拉伯语有害内容检测的共享评测任务。该任务分为两个赛道:Track A 聚焦于阿拉伯语多模态梗图的仇恨言论检测,Track B 则针对阿拉伯语大语言模型安全评估中的有害提示词检测。共有35支团队参与最终评估,广泛测试了 AraBERT、Jais 及 Qwen3-VL 等模型。结果显示提示词安全检测表现优异,而细粒度梗图分类最具挑战性。
推荐理由聚焦阿拉伯语大模型安全与多模态有害内容治理,展示了主流模型在该语言安全评估中的表现基准。
原标题:ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts
阅读 arXiv 自然语言处理 原文 ↗