AIDC
DC AI 热点

全部 AI 动态

9月23日2026-09-23
OpenAI 官方动态✦ 精选AI 评分 65/10018:00

心理健康对话评估基准 MentalHealthBench 正式发布

MentalHealthBench 是一项由专业人士参与制定的新型评估基准,专门用于评测人工智能在真实心理健康对话场景中生成回复的有效性与安全性。该基准针对高敏感度的人机心理交互需求,为检验大模型在心理健康支持场景下的临床安全界限和实用价值提供了标准化评估工具,有助于推动垂直领域 AI 的安全对齐。

阅读原文 ↗推荐理由:填补了心理健康高危场景下专家级 AI 安全与有效性评测基准的空缺。# 安全# 评测# 大模型# 对齐
9月17日2026-09-17
OpenAI 官方动态✦ 精选AI 评分 75/10001:00

OpenAI发布模型失配报告框架并披露六起异常行为案例

OpenAI宣布推出一套专门用于跟踪、调查和披露模型失配(misalignment)问题的标准化报告框架。该框架旨在系统化识别AI模型偏离预期对齐目标的情况。与该框架一同发布的,还包括六份针对意外或令人担忧的模型具体行为的分析报告,展示了其在实际场景中如何监测和应对潜在的安全风险,以提升AI前沿模型在对齐与安全维度的透明度与治理水平。

阅读原文 ↗推荐理由:OpenAI系统化建立模型失配报告与调查机制,为大模型安全对齐与异常行为公开治理提供了前沿实践参考。# OpenAI# 安全# 对齐# 治理# 大模型