华为大模型核心技术人员联手创业,探索物理世界Scaling Law
据消息,华为大模型领域的两位核心专家联手开启创业,将研发重心聚焦于探索物理世界的Scaling Law(尺度定律),旨在开展物理世界的基础模型实验与技术突破。现有素材信息较为简略,尚未披露创业团队的具体成员姓名、融资规模及技术落地路线,但反映出大模型顶尖研发力量向具身智能及物理AI领域延伸探索的动向。
据消息,华为大模型领域的两位核心专家联手开启创业,将研发重心聚焦于探索物理世界的Scaling Law(尺度定律),旨在开展物理世界的基础模型实验与技术突破。现有素材信息较为简略,尚未披露创业团队的具体成员姓名、融资规模及技术落地路线,但反映出大模型顶尖研发力量向具身智能及物理AI领域延伸探索的动向。
该研究探讨了大语言模型(LLM)的评估方法。在多项选择问答任务中,常规基于似然的评分与提示词方法类似均依赖任务上下文。研究团队提出了一种基于问答对构建的陈述句进行似然排序的补充评估协议。通过对95个参数量从1亿到1040亿的仅解码器模型在10个多选题数据集上的测试,系统对比并揭示了似然排序与提示词方法在模型规模扩展表现上的差异。
该研究探讨了大语言模型在推理任务中的“能力”(解题正确率)与“效率”(所需资源消耗)两个核心维度。当模型利用思维链(CoT)处理不同难度的问题时,正确率和所需Token数量均受问题难度与模型规模影响,但两者的联合作用机制此前尚不明确。研究采用分层贝叶斯方法建模分析,旨在揭示模型规模与问题难度如何共同影响推理期的能力与效率扩展。(注:原文摘要存在截断)