开源项目发布 v0.34.4-rc0:通过 MLX 算子优化加速 Qwen 3.8 Prompt 处理
在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。
推荐理由展示了基于 MLX 框架对 Qwen 模型的算子融合与长序列处理加速的具体工程实践。
原标题:v0.34.4-rc0: mlx: speed up Qwen 3.8 prompt processing (#18550)
阅读 Ollama 更新 原文 ↗