AIDC
← 返回全部动态
arXiv 人工智能AI 评分 65/10009月25日 12:00

硬预算重复评测中真实不确定性的理论界限研究

该研究探讨了在硬预算约束下,通过重复评测来准确估计基准测试分数并确保较低不确定性的理论极限。研究在固定任务网格和响应成本限制的框架下,推导出了在完全观察与允许遗漏两种情况下,最差纯群组的最优期望区间宽度理论界限。该理论下界同样适用于自适应硬预算策略,为机器学习模型的基准评测设计与置信度验证提供了严格的理论依据。

推荐理由推导了大模型基准评测在硬预算约束下的不确定性理论极限,为评测协议设计提供了理论指导。

原标题:Sharp Limits for Honest Uncertainty in Hard-Budget Repeated Evaluation

阅读 arXiv 人工智能 原文 ↗