AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 70/10009月25日 12:00

大模型评估研究:似然排序在规模扩展表现上不同于提示词方法

该研究探讨了大语言模型(LLM)的评估方法。在多项选择问答任务中,常规基于似然的评分与提示词方法类似均依赖任务上下文。研究团队提出了一种基于问答对构建的陈述句进行似然排序的补充评估协议。通过对95个参数量从1亿到1040亿的仅解码器模型在10个多选题数据集上的测试,系统对比并揭示了似然排序与提示词方法在模型规模扩展表现上的差异。

推荐理由通过跨越近百个模型的大规模实验,揭示了大语言模型在似然排序与提示词评估方法上的扩展性差异。

原标题:Likelihood Ranking doesn't Scale Like Prompting in LLMs

阅读 arXiv 自然语言处理 原文 ↗