人机协同假设检验:基于成本感知的AI筛选评分与序贯人工复核机制
该研究针对大语言模型作为低成本评审员在统计推断中的局限性展开探讨。研究指出,AI评估往往存在偏差和噪声,而严谨的假设检验必须明确控制第一类和第二类错误。为此,论文提出了一种人机协同的假设检验方案,结合成本感知的AI选择性评分与序贯人工核验升级机制,旨在满足严格统计推断有效性与错误率控制的前提下,最大限度降低整体评估成本。
推荐理由针对LLM作为评估员的噪声与偏差问题,提出了兼顾统计严谨性与成本效益的人机协同检验方法。
原标题:Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation
阅读 arXiv 人工智能 原文 ↗