AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 65/10012:00

硬预算重复评测中真实不确定性的理论界限研究

该研究探讨了在硬预算约束下,通过重复评测来准确估计基准测试分数并确保较低不确定性的理论极限。研究在固定任务网格和响应成本限制的框架下,推导出了在完全观察与允许遗漏两种情况下,最差纯群组的最优期望区间宽度理论界限。该理论下界同样适用于自适应硬预算策略,为机器学习模型的基准评测设计与置信度验证提供了严格的理论依据。

阅读原文 ↗推荐理由:推导了大模型基准评测在硬预算约束下的不确定性理论极限,为评测协议设计提供了理论指导。# 评测# 不确定性量化# 理论下界