AIDC
← 返回全部动态
Ollama 更新AI 评分 55/10009月23日 08:53

开源项目发布 v0.34.4-rc0:通过 MLX 算子优化加速 Qwen 3.8 Prompt 处理

在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。

推荐理由展示了基于 MLX 框架对 Qwen 模型的算子融合与长序列处理加速的具体工程实践。

原标题:v0.34.4-rc0: mlx: speed up Qwen 3.8 prompt processing (#18550)

阅读 Ollama 更新 原文 ↗