AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
vLLM 官方博客(网页)✦ 精选AI 评分 65/100收录 07:49

在 AMD GPU 上探索 vLLM 投机解码技术

本文主要探讨在 AMD GPU 硬件平台上利用 vLLM 推理框架实现投机解码(Speculative Decoding)的技术探索与优化。投机解码是一种有效降低大语言模型推理延迟的高级加速技术。结合 vLLM 与 AMD 算力生态,旨在提升大模型的生成吞吐量。由于原始素材仅提供标题,具体的实现细节、支持的硬件型号及性能评测数据等信息暂未披露。

阅读原文 ↗推荐理由:关注开源推理框架 vLLM 在 AMD GPU 算力平台上的投机解码实践与性能加速。# AMD# vLLM# 投机解码# GPU算力# 推理
9月24日2026-09-24
量子位✦ 精选AI 评分 68/10022:17

PCIe显卡经内核与通信重构优化,DeepSeek推理吞吐提升近7倍

该动态指出通过内核补齐与通信重构等优化手段,PCIe显卡在运行DeepSeek模型时的推理吞吐量提升了近7倍,并声称1.5台6000D设备的表现可超越1台B300。需要说明的是,素材提供的信息较为简短,缺少具体的软硬件环境、完整测试基准以及技术实现的深度细节。

阅读原文 ↗推荐理由:展示了通过底层通信和内核优化挖掘PCIe硬件在DeepSeek大模型推理中算力潜力的方案。# PCIe显卡# DeepSeek# 推理# 吞吐量# 算力
Hugging FaceAI 评分 45/10022:08

借助 LFM2.5-VL-DSpark 加速视觉语言模型

该内容主要探讨如何通过 LFM2.5-VL-DSpark 针对视觉语言模型(VLM)进行性能加速与推理优化。由于提供的原始材料仅包含标题,缺乏详细的摘要和正文内容,目前关于其具体的加速架构、基准测试表现、计算效率提升幅度及技术实现细节均无法获知,需等待官方或作者补充更详尽的技术报告与文档说明。

阅读原文 ↗推荐理由:涉及多模态模型加速优化方向,但因缺乏详细上下文,建议等待完整技术报告披露。# 视觉语言模型# 模型加速# 多模态# 推理# AI模型
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Orthrus:面向迭代检索的异构批处理高效推理服务系统

现代信息检索系统通常同时结合嵌入模型与生成模型处理复杂查询,但现有系统往往将二者隔离部署,粗粒度分配硬件易引发计算气泡,导致 GPU 利用率低和吞吐不足。为此,研究团队提出服务系统 Orthrus。该系统在统一推理循环中引入异构批处理机制,旨在有效整合具有资源冲突特性的嵌入与生成工作负载,提升动态查询下的硬件利用效率。(注:素材摘要文末存在截断)

阅读原文 ↗推荐理由:针对检索增强等场景中嵌入与生成模型混部低效的痛点,提出了创新的异构推理批处理系统设计。# 推理# 异构计算# GPU利用率# 信息检索# 系统架构
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

注意力路由提前稳定:面向循环语言模型的工作集推理机制

针对循环语言模型在每个循环步骤重复计算全局注意力导致的高开销问题,研究人员分析了跨循环深度的注意力动态。研究发现,注意力分布和支撑集稳定的时间显著早于隐藏状态与输出,呈现出两阶段特征:前期步骤先确定相关上下文的稀疏工作集,后期步骤则在基本固定的路由支撑上细化表征。基于该发现,论文提出了名为 WISE 的工作集推理方法以优化推理过程(原文摘要末尾有所截断)。

阅读原文 ↗推荐理由:揭示了循环语言模型中注意力路由提前稳定的关键特性,为长序列与循环推理加速提供了新思路。# 循环语言模型# 注意力机制# 推理# 深度学习
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

DPara:结合并行草稿器与并行投机解码的高效推理框架

针对大模型推理加速,现有并行投机解码(PSD)虽能重叠草稿生成与验证过程,但往往依赖对接受前缀和额外标记的预先猜测,猜错会导致批处理回退至低效的串行起草。论文提出 DPara 框架,在复用高效并行草稿器的同时,确保目标模型验证与起草阶段在每一轮均实现重叠,彻底消除了概率性回退缺陷,保障了投机解码流水线的高效利用。注:素材末尾存在文本截断。

阅读原文 ↗推荐理由:提出 DPara 框架解决了并行投机解码中因猜测失误而退化为串行的痛点,进一步提升大模型推理吞吐与时延表现。# 投机解码# 大模型# 推理# 并行计算# 模型架构
arXiv 人工智能✦ 精选AI 评分 72/10012:00

对比认知解码:通过单模型双前向推理缓解大模型的盲从共识偏见

针对大语言模型容易受对抗性群体共识影响而产生盲从(阿谀)现象的问题,研究人员提出了对比认知解码(CED)。不同于依赖弱辅助模型的传统对比解码,CED在单模型架构上通过双重前向传播来隔离从众偏见。该方法引入了新型非对称零边界概率钳位和离散Top-k截断掩码,在数学上抑制有害的从众Token生成且避免语法崩塌,为零样本推理阶段的模型自主性提供了有效干预手段。

阅读原文 ↗推荐理由:提出了一种无需外挂辅助模型的推理期对比解码算法,有效缓解大语言模型的群体盲从偏差。# 大模型# 对比解码# 从众偏见# 推理# 模型健壮性
arXiv 人工智能✦ 精选AI 评分 75/10012:00

面向长程智能体高效压缩的证据感知上下文缩减方法

针对长程智能体因累积大量交互历史导致上下文和推理成本高昂的问题,该研究指出仅依据几何冗余进行压缩并不安全。实验发现,即便全局几何特征高度相似,所保留的关键任务证据也可能存在巨大差异。基于此提出的证据感知选择机制,在相同数据块保留量且质心相似度达0.98的前提下,将下一步动作Top-3保留率从0.31大幅提升至0.69,有效保障了智能体压缩后的决策性能。

阅读原文 ↗推荐理由:该研究针对长程智能体上下文爆炸与推理成本痛点,提出了兼顾几何结构与任务证据的高效压缩新策略。# 智能体# 上下文压缩# 推理# 长程任务# 模型效率
Ollama 更新AI 评分 35/10007:36

mlxrunner 发布 v0.34.4-rc1:升级 XGrammar 0.2.7 优化结构化输出

mlxrunner 发布了 v0.34.4-rc1 预发布版本。该版本将 XGrammar 依赖项升级至 0.2.7 版本,以改善模型的结构化输出能力。本次更新重点包含针对模式(Schema)的修复,解决了带类型字典值以及短数组在处理过程中的相关问题。原素材为轻量级版本发布说明,提供的具体技术细节相对有限。

阅读原文 ↗推荐理由:属于推理运行框架针对结构化输出功能的常规依赖项升级与模式修复更新。# mlxrunner# XGrammar# 结构化输出# 推理# 软件更新
Microsoft Research✦ 精选AI 评分 78/10000:01

微软提出机器人推理卸载架构,以突破物理AI硬件算力瓶颈

微软研究院针对机器人硬件难以跟上AI能力增长的瓶颈,发布了有关“推理卸载”的最新研究成果。研究表明,将AI模型的推理计算任务转移至机器人本体之外的外部计算平台,能够显著提升任务执行的成功率并提高系统效率,同时支持运行更为复杂的先进物理AI工作负载,为智能机器人突破车载硬件限制提供了可行的计算架构方案。

阅读原文 ↗推荐理由:微软针对具身智能算力瓶颈探讨了推理卸载方案,对物理AI落地应用具有重要的架构参考价值。# 微软研究院# 具身智能# 推理
9月23日2026-09-23
AI Roundup · X AI coding圈日报✦ 精选AI 评分 75/10014:00

Anthropic与OpenAI接连发布新模型打响价格战:Opus 5.5与GPT-6 Sol相继亮相

Anthropic发布Claude Opus 5.5,OpenAI随后推出GPT-6 Sol与Luna,两大厂商掀起新一轮价格战。Opus 5.5每百万Token输入/输出定价为4/20美元,缓存读取成本降至0.20美元;OpenAI的Sol与Luna价格则减半至2/10美元与0.10/0.50美元。第三方评测机构Artificial Analysis指出,Opus 5.5因任务Token消耗量增加,高负载下单任务实际成本与前代基本持平。

阅读原文 ↗推荐理由:头部大模型厂商接连推出新模型并大幅降低API调用价格,反映了大模型商业化竞争的最新趋势。# 大模型# OpenAI# Anthropic# 评测# 推理
Ollama 更新AI 评分 55/10008:53

开源项目发布 v0.34.4-rc0:通过 MLX 算子优化加速 Qwen 3.8 Prompt 处理

在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。

阅读原文 ↗推荐理由:展示了基于 MLX 框架对 Qwen 模型的算子融合与长序列处理加速的具体工程实践。# MLX# Qwen# 推理# 芯片# 开源
Simon Willison✦ 精选AI 评分 60/10007:46

大模型密集更新与价格战:评Claude Opus 5.5及GPT-6系列等新模型动态

文章盘点了近期密集发布的虚构或前瞻性大模型动态,涵盖Anthropic的Claude Opus 5.5,以及OpenAI的GPT-6 Sol和GPT-6 Luna等。作者指出,新一代模型在定价上掀起更激烈的价格战,其中GPT-6 Sol与Luna的定价仅为其上一代对应版本的一半,在兼顾高性能的同时大幅压低应用开发成本,引发对模型性价比与开发者生态的新一轮讨论。

阅读原文 ↗推荐理由:聚焦头部AI厂商新模型发布及大幅降价带来的价格战与开发者生态影响。# 大模型# OpenAI# Anthropic# 推理
OpenAI 官方动态✦ 精选AI 评分 75/10005:00

GPT-6引入改进版提示词缓存:提升命中率并降低延迟与成本

文章介绍了针对GPT-6优化的提示词缓存(Prompt Caching)技术。该机制通过实现更高的缓存命中率、引入全新诊断工具、显式断点设置以及细粒度控制功能,帮助开发者在调用模型时有效减少推理延迟并降低API使用成本。摘要中未提及更多底层架构细节或具体的性能测试对比数据。

阅读原文 ↗推荐理由:介绍了下一代大模型在提示词缓存与推理成本优化方面的重要工程改进。# 大模型# 推理# 提示词工程# GPT-6
Ollama 更新✦ 精选AI 评分 60/10004:42

Ollama 发布 v0.34.3 版本更新,支持模型思考控制查询与 Nemotron 视觉模型

本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。

阅读原文 ↗推荐理由:开源大模型本地部署与推理工具 Ollama 的功能更新,增强了思考参数控制及多模态模型支持。# Ollama# 开源# 推理# 端侧AI# 多模态
Simon WillisonAI 评分 50/10002:48

命令行大模型工具 llm 发布 0.36 版本

开源命令行工具与 Python 库 llm 发布 0.36 版本。新版本新增了对 gpt-6-sol 和 gpt-6-luna 模型的支持;模型插件现可声明 supports_conversation = False,用于处理仅支持单轮提示词的模型,并在接收对话历史时主动报错;同时,llm logs 的 Markdown 输出中将推理链跟踪折叠显示,并修复了多项社区贡献的问题。

阅读原文 ↗推荐理由:知名开源 LLM 命令行工具的小版本发布,新增单轮对话模型限制和日志优化等工程特性。# 开源# AI编程# 大模型# 推理# OpenAI
AWS 机器学习✦ 精选AI 评分 65/10002:10

GPT-6 Sol 与 GPT-6 Luna 正式上线 Amazon Bedrock

GPT-6 Sol 与 GPT-6 Luna 模型现已在 Amazon Bedrock 平台正式全面可用(GA)。这两款新模型的引入,旨在帮助开发者和企业用户根据不同业务工作负载的具体需求,更灵活地在智能水平与运行效率之间进行权衡和匹配,从而为日常工作流及各类生产力场景提供更多样化的生成式 AI 模型选择。

阅读原文 ↗推荐理由:Amazon Bedrock 正式上线新模型,丰富了云端大模型部署与工作流调用的生态选择。# 大模型# 推理# Amazon
OpenAI 官方动态✦ 精选AI 评分 88/10002:00

GPT-6 Sol 与 Luna 模型正式发布

本次发布推出了 GPT-6 Sol 和 GPT-6 Luna 两款全新前沿模型。这两款模型旨在将前沿智能能力引入日常工作场景中,并通过在模型能力与使用成本之间提供不同的平衡方案,满足用户在不同业务需求下对高性能与高性价比的差异化诉求。

阅读原文 ↗推荐理由:全新 GPT-6 系列模型发布,展示了针对能力与成本进行分层优化的前沿大模型路线。# 大模型# 推理
NVIDIA Developer Blog✦ 精选AI 评分 75/10001:27

英伟达推出机密计算方案,助力实现私有高性能生产级AI推理

随着大语言模型(LLM)推理在个人、企业及受监管行业中日益广泛地处理敏感数据和专有模型上下文,隐私与安全防护变得至关重要。英伟达通过其机密计算(Confidential Computing)技术,致力于在保护数据隐私和知识产权的同时,提供生产级的高性能AI推理能力,确保大模型在云端及基础设施中的安全可靠运行。

阅读原文 ↗推荐理由:介绍了英伟达利用硬件机密计算保护大模型推理敏感数据的安全解决方案。# 英伟达# 安全# 推理# 隐私计算# 大模型
The Next Platform✦ 精选AI 评分 65/10001:06

向量搜索渐成基础数据类型,但成本与商业经济账仍待解决

文章探讨了向量搜索(Vector Search)技术的发展现状。虽然向量搜索正逐渐演进为一种基础数据类型并集成至各类数据库系统中,但其背后的算力消耗、存储开销及整体经济成本(Money Math)依然是企业在实际落地时需要面对的核心挑战。由于输入材料缺乏详细摘要,具体的技术方案与财务分析细节尚不充分。

阅读原文 ↗推荐理由:探讨了向量搜索作为AI核心基础设施的技术演进及伴随的成本经济问题。# RAG# 算力# 推理# 自然语言处理
9月22日2026-09-22
Simon WillisonAI 评分 35/10023:54

LLM CLI 插件 llm-typesafe 0.1a0 发布,支持 TypeSafe AI 的 Jev 模型

开发者发布了适用于 LLM CLI 工具的全新插件 llm-typesafe 0.1a0,新增对 TypeSafe AI 旗下 Jev 模型的调用支持。用户通过安装该插件并配置对应 API 密钥后,即可利用 Jev 模型执行结构化判定任务,例如针对文本的是非概率判断(输出置信度得分),以及在预设条件下的多类别选择与意图路由,便于在命令行及自动化工作流中集成类型安全的模型交互。

阅读原文 ↗推荐理由:介绍了支持 TypeSafe AI 新模型的命令行工具插件,便于开发者进行轻量级的结构化推理调用。# 开源# 大模型# AI编程# 推理
AWS 机器学习✦ 精选AI 评分 70/10023:35

利用 Amazon SageMaker AI 并发扫描功能优化生成式 AI 端点算力配置

Amazon SageMaker AI 推出并发扫描功能,帮助用户在不同负载水平下系统性基准测试生成式 AI 端点,以实现算力资源的合理配置(Right-sizing)。文章详细介绍了模型部署流程,以及如何利用 CreateAIBenchmarkJob API 运行自动化并发测试,并根据测试结果在算力集群规模(Fleet Size)和容量规划上做出基于数据的决策。

阅读原文 ↗推荐理由:介绍了在 AWS SageMaker 上利用自动化并发基准测试优化大模型推理端点算力配置的实用工程方法。# 大模型# 推理# 评测# 算力# AWS
AWS 机器学习✦ 精选AI 评分 68/10023:19

Tata Elxsi 基于 AWS 构建工业安全平台 IRIS,实现秒级风险检测

Tata Elxsi 基于 AWS 构建了实时工业安全平台 IRIS。该平台通过在边缘端对摄像头视频进行过滤,利用 Amazon Kinesis 传输元数据,并在 Amazon SageMaker AI 上运行计算机视觉模型,将检测结果关联为高置信度警报。该系统将不安全工况的检测时间从数分钟缩短至数秒,显著提升了工业现场的安全响应效率。

阅读原文 ↗推荐理由:展示了结合边缘计算、云计算与计算机视觉的工业安全落地应用工程方案。# 计算机视觉# 端侧AI# 推理# AWS
OpenAI 官方动态✦ 精选AI 评分 68/10020:00

Parallel 利用 GPT-6 Astra 将数据调研时间和成本减半

Parallel 宣布采用 GPT-6 Astra 模型赋能其智能体应用。与先前的模型相比,搭载该模型的智能体在调研和整合劳动力市场数据时,将所需时间缩短了一半,同时计算与调研成本也降低了50%,显著提升了特定场景下的工作效率与经济效益。

阅读原文 ↗推荐理由:展示了大模型在实际业务智能体工作流中带来的显著降本增效成果。# 智能体# 大模型# 推理
vLLM 更新✦ 精选AI 评分 75/10013:20

大模型推理框架发布 v0.30.0 版本:新增 DeepSeek-V4.1、GLM-5.3 等多款模型及优化支持

开源大模型推理框架发布 v0.30.0 版本更新,包含来自 315 位贡献者的 762 次提交。新版本支持了多款前沿大模型及架构优化,包括支持 MXFP8 格式 KV 缓存与 FlashMLA 的 DeepSeek-V4.1-Flash、支持 ROCm 与 LoRA 的 DeepSeek-V4-Flash-Vision-Exp、支持 EPLB 的 GLM-5.3-Flash,以及 K2-Horizon、Cohere Compass、Bailing V3 VL 等,并引入了基于 AVX512/AMX 的 CPU 后端支持。

阅读原文 ↗推荐理由:包含 DeepSeek-V4.1、GLM-5.3 等最新模型的推理支持及 FlashMLA、MXFP8 等底层算力优化特性。# 大模型# 推理# 开源# 算力# 多模态
Hugging Face✦ 精选AI 评分 75/10008:00

Transformers 现已支持直接运行 llama.cpp 量化模型

Hugging Face 旗下核心框架 Transformers 现已支持直接加载和运行 llama.cpp 的量化格式模型。该功能进一步融合了主流开源推理生态,允许开发者在 Transformers 生态内直接使用经过 llama.cpp 极限量化的模型权重,大幅降低本地推理的显存占用并提升部署灵活性。由于输入信息较少,详细支持范围与参数请参阅官方更新说明。

阅读原文 ↗推荐理由:打通了主流开源大模型框架与轻量化量化格式的生态壁垒,极大便利了开发者的低成本部署。# 大模型# 开源# 模型压缩# 推理# Hugging Face
Anthropic 官方动态(网页)✦ 精选AI 评分 75/10008:00

Anthropic 推出 Claude Opus 5.5 模型

根据提供的新闻标题,Anthropic 或相关方发布了新一代旗舰大模型 Claude Opus 5.5。由于当前输入素材未提供详细摘要和正文内容,关于该模型的具体架构改进、性能评测基准、上下文窗口以及上线部署情况等细节信息暂不明确。

阅读原文 ↗推荐理由:涉及头部大模型系列 Claude Opus 的新版本发布动态,具备较高行业关注度。# 大模型# Claude# Anthropic# 推理# 自然语言处理
Simon Willison✦ 精选AI 评分 72/10007:09

TypeSafe AI 推出决策模型 Jev:专注概率决策输出的新型大模型形态

TypeSafe AI 近期发布了名为 Jev 的新型模型,将其定义为“系统一模型”(System One)或“决策模型”。与传统大模型输出文本不同,Jev 虽接收非结构化文本输入,但直接返回代表分类、是非判断、评级及置信度的浮点数,实现“输入非结构化状态,输出类型化概率决策”。该模型类似前沿智能函数调用,相比传统大语言模型具有更快的响应速度和更低的成本。

阅读原文 ↗推荐理由:展示了一种跳脱出传统文本生成的全新决策模型范式,为低成本、高速度的结构化推理提供了新方向。# 大模型# 推理# TypeSafe AI
NVIDIA Developer Blog✦ 精选AI 评分 72/10005:51

英伟达在Dynamo-Triton中集成TensorRT多设备推理,简化多GPU模型部署服务

随着生成式AI对计算与显存的需求不断超出单卡上限,英伟达推出TensorRT多设备推理新功能,并将其集成至NVIDIA Dynamo-Triton中。该方案旨在简化跨多个GPU的大模型推理服务部署流程,有效降低多卡分布式推理的工程复杂度,提升大规模生成式AI模型在多GPU环境下的服务效率与吞吐能力。

阅读原文 ↗推荐理由:英伟达针对多卡推理服务集成新功能,有助于降低大模型分布式推理部署的工程门槛。# 英伟达# 推理# 算力# 大模型
AWS 机器学习✦ 精选AI 评分 75/10002:30

xAI旗下Grok 4.6正式上线Amazon Bedrock平台

xAI的前沿模型Grok 4.6现已正式登陆Amazon Bedrock平台。该模型专为长时间运行的智能体、编程和知识型工作设计,配备500K token的超长上下文窗口,并提供四个推理努力等级。用户可通过bedrock-mantle和bedrock-runtime端点调用,并获得Converse API及跨区域推理功能支持。

阅读原文 ↗推荐理由:xAI核心模型接入主流云服务商AWS Bedrock,标志着其商业化与生态分发进一步拓展。# xAI# 大模型# 智能体# 推理# AI编程