本地大模型工具发布 v0.34.4:优化思维模型结构化输出与 Apple Silicon 性能
本地大模型工具发布 v0.34.4 版本更新。新版本支持在思考模型上单次生成结构化输出,提升了运行速度与可靠性;同时加速了 Apple Silicon 设备上 Qwen 3.8 的提示词处理,并改进了 Gemma 4 对高分辨率图像的处理机制。此外,更新修复了大型本地库偶发“模型未找到”及 macOS 界面卡顿等问题,并同步升级了 llama.cpp、MLX 和 XGrammar 依赖。
本地大模型工具发布 v0.34.4 版本更新。新版本支持在思考模型上单次生成结构化输出,提升了运行速度与可靠性;同时加速了 Apple Silicon 设备上 Qwen 3.8 的提示词处理,并改进了 Gemma 4 对高分辨率图像的处理机制。此外,更新修复了大型本地库偶发“模型未找到”及 macOS 界面卡顿等问题,并同步升级了 llama.cpp、MLX 和 XGrammar 依赖。
本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。
本地大模型运行框架 Ollama 发布 v0.34.2 版本更新。新版本新增了首次运行时的设置流程,用户可选择登录或直接在本地继续使用,且设置状态可在 macOS 和 Windows 桌面应用间共享;支持通过 ollama://apps 协议直接唤起桌面应用的应用页面;修复了在使用 MLX 推测解码进行长文本生成时内存过度占用的问题,并同步更新了底层 llama.cpp 依赖。
在 v0.34.2-rc2 版本中,mlxrunner 修复了投机解码过程中的内存泄漏问题。此前解码循环仅在生成 Token 数量恰好为 256 的整数倍时释放 MLX 缓冲区池;但投机解码每轮会生成多个 Token,容易直接跨过该固定边界导致释放逻辑未触发。在长上下文生成场景下,未释放的旧 KV 缓存会导致显存占用不断攀升直至 OOM。新版本修改为只要单轮跨越 256 边界即触发释放。
mlxrunner 推出 v0.34.2-rc1 预发布版本,重点对 model 模块进行了结构重构。新版本梳理了 runner 与模型架构协议、检查点打开以及从检查点张量构建神经网络层这三项核心职责。通过将 base.go 重命名为 model.go,并把 safetensors 头部扫描与 TensorQuantInfo 集中归入 quant.go,使得检查点量化信息的读取与解析逻辑更加聚合规范,同时规范了 nvfp4 等全局缩放辅助工具的处理。