AIDC
DC AI 热点

全部 AI 动态

9月23日2026-09-23
Ollama 更新AI 评分 55/10008:53

开源项目发布 v0.34.4-rc0:通过 MLX 算子优化加速 Qwen 3.8 Prompt 处理

在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。

阅读原文 ↗推荐理由:展示了基于 MLX 框架对 Qwen 模型的算子融合与长序列处理加速的具体工程实践。# MLX# Qwen# 推理# 芯片# 开源
Ollama 更新✦ 精选AI 评分 60/10004:42

Ollama 发布 v0.34.3 版本更新,支持模型思考控制查询与 Nemotron 视觉模型

本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。

阅读原文 ↗推荐理由:开源大模型本地部署与推理工具 Ollama 的功能更新,增强了思考参数控制及多模态模型支持。# Ollama# 开源# 推理# 端侧AI# 多模态
9月19日2026-09-19
Ollama 更新AI 评分 15/10008:15

开源项目发布 v0.34.3-rc1 候选版本

该版本为开源项目的 v0.34.3-rc1 预发布更新,核心变更包括在服务端支持白名单主机之间的跨主机注册表重定向(cross-host redirects)。由于原始信息较为简略,未披露该软件的具体所属项目名称及更多详细更新日志,主要属于底层网络与注册表访问控制的工程优化更新。

阅读原文 ↗推荐理由:常规开源项目预发布候选版本,信息量较少且仅涉及局部网络重定向优化。# 开源
Ollama 更新AI 评分 35/10005:10

v0.34.3-rc0 发布:API 支持暴露模型思考级别与默认配置

该发布候选版本(v0.34.3-rc0)的核心更新为通过 API 接口公开了模型的“思考级别”(thinking levels)及其默认参数设置(PR #18473)。该功能主要用于适配和精细调控具备显式思考过程的大模型推理行为。由于原始素材仅提供单行更新日志,未指明所属具体开源软件项目及更多技术细节,整体信息较为有限。

阅读原文 ↗推荐理由:涉及大模型思考推理参数的 API 支持更新,但素材仅为简略的版本候选更新记录,信息量较少。# 推理# 大模型# 开源
9月18日2026-09-18
Ollama 更新AI 评分 45/10007:04

Ollama 发布 v0.34.2 版本,修复 MLX 推测解码内存增长问题并更新 llama.cpp

本地大模型运行框架 Ollama 发布 v0.34.2 版本更新。新版本新增了首次运行时的设置流程,用户可选择登录或直接在本地继续使用,且设置状态可在 macOS 和 Windows 桌面应用间共享;支持通过 ollama://apps 协议直接唤起桌面应用的应用页面;修复了在使用 MLX 推测解码进行长文本生成时内存过度占用的问题,并同步更新了底层 llama.cpp 依赖。

阅读原文 ↗推荐理由:本地大模型运行工具 Ollama 的常规维护更新,修复了推理长文本内存泄漏并优化了桌面端交互流程。# Ollama# 开源# 推理# 端侧AI# llama.cpp
Ollama 更新AI 评分 15/10002:49

v0.34.2-rc3 版本发布,新增 CLI 首次运行引导功能

该版本为预发布候选版本 v0.34.2-rc3。更新内容主要为命令行界面(CLI)新增了与桌面端应用共享的首次运行引导流程(Onboarding)。原始素材信息较为简略,未明确披露该软件的具体项目名称及更多详细更新内容。

阅读原文 ↗推荐理由:仅包含单一工程化小更新且项目背景信息缺失,参考价值有限。# 开源
Ollama 更新AI 评分 55/10000:45

mlxrunner 修复投机解码场景下的 KV 缓存内存泄漏缺陷

在 v0.34.2-rc2 版本中,mlxrunner 修复了投机解码过程中的内存泄漏问题。此前解码循环仅在生成 Token 数量恰好为 256 的整数倍时释放 MLX 缓冲区池;但投机解码每轮会生成多个 Token,容易直接跨过该固定边界导致释放逻辑未触发。在长上下文生成场景下,未释放的旧 KV 缓存会导致显存占用不断攀升直至 OOM。新版本修改为只要单轮跨越 256 边界即触发释放。

阅读原文 ↗推荐理由:针对投机解码在长上下文生成时的显存泄漏缺陷进行了针对性修复,提升了推理稳定性。# 推理# 大模型# 开源# 端侧AI
9月17日2026-09-17
Ollama 更新AI 评分 42/10005:06

mlxrunner 发布 v0.34.2-rc1:重构模型代码架构并整合量化逻辑

mlxrunner 推出 v0.34.2-rc1 预发布版本,重点对 model 模块进行了结构重构。新版本梳理了 runner 与模型架构协议、检查点打开以及从检查点张量构建神经网络层这三项核心职责。通过将 base.go 重命名为 model.go,并把 safetensors 头部扫描与 TensorQuantInfo 集中归入 quant.go,使得检查点量化信息的读取与解析逻辑更加聚合规范,同时规范了 nvfp4 等全局缩放辅助工具的处理。

阅读原文 ↗推荐理由:mlxrunner 推理运行框架的代码模块重构与维护版本,主要涉及量化解析和文件架构优化,技术影响力有限。# 开源# 推理# 端侧AI# 模型压缩