大模型自动批卷的成败边界:两门计算机考试的实证研究
一项来自学术界的新研究评估了大语言模型(LLM)用于高校考试自动评分的可靠性与局限。研究团队在包含570名学生的计算机视觉考试上测试了开源与闭源模型的171种配置。结果显示,最优模型的平均绝对误差达到1.64/35,甚至优于两位人类评分员之间2.61/35的分歧水平。然而实验发现模型对提示词极度脆弱:加入一句简短的“严格评分”提示,便导致17个开源模型中的14个评分严重失常,甚至有模型直接停止评分。
推荐理由通过严谨实证揭示了大模型在主观题阅卷中的高精度潜力与对提示词微调的极端脆弱性。
原标题:Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams
阅读 arXiv 自然语言处理 原文 ↗