ROCm CI 新增 AMD MI355 芯片 Dense NVFP4 与 MoRI 算子镜像支持
开源项目在 v0.30.1rc0 版本更新中,针对 AMD ROCm 持续集成(CI)流程添加了下一代加速卡 MI355 的 Dense NVFP4 精度及 MoRI 算子内核镜像。该更新由 AMD 工程师提交,旨在完善对 AMD 新一代硬件低精度计算格式的持续集成测试与底层算子支持,加速相关 AI 框架对 MI355 算力生态的适配。
开源项目在 v0.30.1rc0 版本更新中,针对 AMD ROCm 持续集成(CI)流程添加了下一代加速卡 MI355 的 Dense NVFP4 精度及 MoRI 算子内核镜像。该更新由 AMD 工程师提交,旨在完善对 AMD 新一代硬件低精度计算格式的持续集成测试与底层算子支持,加速相关 AI 框架对 MI355 算力生态的适配。
开源大模型推理框架发布 v0.30.0 版本更新,包含来自 315 位贡献者的 762 次提交。新版本支持了多款前沿大模型及架构优化,包括支持 MXFP8 格式 KV 缓存与 FlashMLA 的 DeepSeek-V4.1-Flash、支持 ROCm 与 LoRA 的 DeepSeek-V4-Flash-Vision-Exp、支持 EPLB 的 GLM-5.3-Flash,以及 K2-Horizon、Cohere Compass、Bailing V3 VL 等,并引入了基于 AVX512/AMX 的 CPU 后端支持。
该版本为 v0.30.0rc2 预发布候选版本,主要包含针对 NIXL 模块的缺陷修复(Bugfix),旨在避免仅通知类请求(notification-only requests)接收报告。由于输入素材信息较为有限,更多具体更新内容及完整变更日志需参考官方项目发布页面。
本动态为开源项目的 v0.30.0rc1 预发布版本修复记录(PR #57285)。该修复主要针对 FlashInfer 库在 BF16 精度下的补充自动调优(autotuning)逻辑进行了隔离处理,旨在提升相关推理计算的稳定性和性能表现。由于原始素材仅为 Git 代码合并签名记录,未披露具体的 Bug 表现及更多技术细节。
开源大模型推理引擎 vLLM 的关联组件库 vllm-proto 正式发布 0.3.0 版本。由于发布页面目前仅包含版本更新标签,未提供详细的更新日志、特性列表或功能改进说明,具体变更细节有待官方进一步补充披露。该库通常用于定义 vLLM 相关的协议缓冲区与接口规范,为推理系统服务化提供基础通信支持。
开源大语言模型推理框架 vLLM 相关协议组件 vllm-proto 发布 0.2.0 版本更新。当前素材仅包含该版本通过相关 Pull Request CI 验证的基础记录,未披露具体的更新日志、新特性及性能优化等技术细节,整体信息较为有限。
该更新为开源项目的 v0.29.1rc0 预发布版本,主要增加了针对投机解码(Speculative Decoding)的双密钥 Gumbel-Max 水印(Dual-key Gumbel-Max Watermarking)技术。该功能旨在为大模型加速推理与投机采样流程提供文本水印嵌入与溯源能力,兼顾推理效率与生成内容的安全性。输入素材信息有限,主要展示了该特定算法的合并与版本发布。