AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 70/10009月24日 12:00

PRISM-VLM:面向紧凑型视觉语言模型的多维度判别评测基准

针对现有评测基准多沿袭前沿大模型设计、导致紧凑型视觉语言模型难以拉开区分度的问题,研究人员推出了 PRISM-VLM 评测基准。该基准围绕轻量级多模态模型的常见失效模式,从任务质量、行为鲁棒性和能力瓶颈等七个关键维度对每个评测样本进行综合打分,并将其融合为单一的 PScore 指标,从而更精确、精细地评估紧凑型多模态模型的真实表现与局限性。

推荐理由针对轻量级多模态模型评测区分度不足的痛点,提出了涵盖多失效模式的细粒度评测体系。

原标题:PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models

阅读 arXiv 自然语言处理 原文 ↗