腾讯发布Hunyuan-A13B开源MoE模型技术报告
该技术报告介绍了开源大语言模型Hunyuan-A13B。该模型采用混合专家(MoE)架构,总参数量为800亿,推理时仅激活130亿参数,有效兼顾了模型性能、计算效率与部署成本。模型在经过严格清洗且强化STEM领域的20T token语料上进行预训练,并结合高质量SFT与大规模强化学习,同时引入了双模式思维链(CoT)框架,显著提升了事实可靠性与逻辑推理能力。
推荐理由混元开源80B MoE大模型并公开技术报告,其激活13B参数的设计对端侧及高效部署极具参考价值。
原标题:Hunyuan-A13B Technical Report
阅读 arXiv 人工智能 原文 ↗