llama-server 发布 v0.40.0-rc0 候选版本:重构清单管理并推进移除兼容补丁
llama-server 发布 v0.40.0-rc0 候选版本,着手准备移除历史兼容补丁。该版本引入了清单列表存储机制,支持在同一标签下共存针对特定运行时的清单配置,CLI 工具也全面支持基于 runner 和摘要的选择与传输。新版还为旧版 Ollama GGUF 模型增加了向 llama.cpp 兼容格式的惰性本地迁移能力,完整保留模板、投射器及 MTP 等元数据,并同步扩展了创建与导入路径。
llama-server 发布 v0.40.0-rc0 候选版本,着手准备移除历史兼容补丁。该版本引入了清单列表存储机制,支持在同一标签下共存针对特定运行时的清单配置,CLI 工具也全面支持基于 runner 和摘要的选择与传输。新版还为旧版 Ollama GGUF 模型增加了向 llama.cpp 兼容格式的惰性本地迁移能力,完整保留模板、投射器及 MTP 等元数据,并同步扩展了创建与导入路径。
本地大模型工具发布 v0.34.4 版本更新。新版本支持在思考模型上单次生成结构化输出,提升了运行速度与可靠性;同时加速了 Apple Silicon 设备上 Qwen 3.8 的提示词处理,并改进了 Gemma 4 对高分辨率图像的处理机制。此外,更新修复了大型本地库偶发“模型未找到”及 macOS 界面卡顿等问题,并同步升级了 llama.cpp、MLX 和 XGrammar 依赖。
mlxrunner 发布了 v0.34.4-rc1 预发布版本。该版本将 XGrammar 依赖项升级至 0.2.7 版本,以改善模型的结构化输出能力。本次更新重点包含针对模式(Schema)的修复,解决了带类型字典值以及短数组在处理过程中的相关问题。原素材为轻量级版本发布说明,提供的具体技术细节相对有限。
本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。
该发布候选版本(v0.34.3-rc0)的核心更新为通过 API 接口公开了模型的“思考级别”(thinking levels)及其默认参数设置(PR #18473)。该功能主要用于适配和精细调控具备显式思考过程的大模型推理行为。由于原始素材仅提供单行更新日志,未指明所属具体开源软件项目及更多技术细节,整体信息较为有限。
本地大模型运行框架 Ollama 发布 v0.34.2 版本更新。新版本新增了首次运行时的设置流程,用户可选择登录或直接在本地继续使用,且设置状态可在 macOS 和 Windows 桌面应用间共享;支持通过 ollama://apps 协议直接唤起桌面应用的应用页面;修复了在使用 MLX 推测解码进行长文本生成时内存过度占用的问题,并同步更新了底层 llama.cpp 依赖。
在 v0.34.2-rc2 版本中,mlxrunner 修复了投机解码过程中的内存泄漏问题。此前解码循环仅在生成 Token 数量恰好为 256 的整数倍时释放 MLX 缓冲区池;但投机解码每轮会生成多个 Token,容易直接跨过该固定边界导致释放逻辑未触发。在长上下文生成场景下,未释放的旧 KV 缓存会导致显存占用不断攀升直至 OOM。新版本修改为只要单轮跨越 256 边界即触发释放。
mlxrunner 推出 v0.34.2-rc1 预发布版本,重点对 model 模块进行了结构重构。新版本梳理了 runner 与模型架构协议、检查点打开以及从检查点张量构建神经网络层这三项核心职责。通过将 base.go 重命名为 model.go,并把 safetensors 头部扫描与 TensorQuantInfo 集中归入 quant.go,使得检查点量化信息的读取与解析逻辑更加聚合规范,同时规范了 nvfp4 等全局缩放辅助工具的处理。