AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
Google Developers · AI 筛选✦ 精选AI 评分 75/100收录 00:15

基于 Tunix 与 TPU 的自主大模型后训练框架 autofinetune 推出

autofinetune 项目推出了一套全自动大模型后训练研究闭环,涵盖监督微调(SFT)和基于 GRPO 的强化学习。开发者只需在单个 Markdown 文档中设定边界条件与评估指标,AI Agent 便能自主修改训练脚本、发起实验,并将验证有效的超参数优化自动提交至 Git。该项目基于 Google 的 Tunix、Gemma 和 Cloud TPU 技术栈构建,消除了繁琐的人工微调过程,已在函数调用与数学推理任务中验证了无人工干预的性能提升。

阅读原文 ↗推荐理由:实现了涵盖 SFT 与 GRPO 强化学习的自主后训练闭环,展示了 AI Agent 自动调优模型的工程落地潜力。# 微调# 芯片# 强化学习# 工作流# Gemma
9月24日2026-09-24
IT之家 · AI 筛选✦ 精选AI 评分 78/10022:02

谷歌启动“捕日计划”:将发射首颗试验卫星探索太空AI数据中心

谷歌计划于10月1日发射名为MVP的实验卫星,作为其“捕日计划”的前期验证。该卫星搭载4枚TPU芯片,算力相当于一台普通服务器,由约1kW的太阳能面板供电,能在太空中直接处理并回答简单的AI查询。此项试验旨在检验计算硬件抵御太空辐射等严苛环境的能力,探索利用太空太阳能运行算力设施的可行性,为未来缓解地面数据中心面临的能耗与空间限制积累技术经验。

阅读原文 ↗推荐理由:谷歌率先推进轨道算力实验,展现了应对地面能耗瓶颈、探索太空AI基础设施的前沿尝试。# Google# 太空数据中心# 芯片# 算力# 捕日计划
arXiv 人工智能✦ 精选AI 评分 75/10012:00

XLOG:面向神经符号集成的 CUDA 原生逻辑编程引擎

论文提出了用于神经符号集成的 CUDA 原生逻辑编程引擎 xlog。该引擎通过类型化前端与 CUDA 运行时,将神经感知与确定性 Datalog、概率推理及认知世界观相结合。各推理模式共享 GPU 设备数据平面,其中常驻递归与蒙特卡洛采样核心在特定推理阶段实现了零主机-设备数据传输开销。此外,其概率推理路径支持通过 GPU 知识编译完成端到端梯度计算,显著提升了神经符号推理的硬件执行效率。

阅读原文 ↗推荐理由:提出了一种面向神经符号推理的 CUDA 原生逻辑编程引擎,在 GPU 层面优化了符号逻辑与深度学习的集成效率。# 神经符号系统# 芯片# 概率推理# GPU加速
InfoQ · 架构与云计算AI 评分 58/10005:57

4096张卡如何成为“一台计算机”?解析华为超节点布局

该内容探讨华为在AI算力基础设施领域的超节点技术布局,重点关注如何通过先进的互联与系统架构,将4096张计算卡高效协同、聚合成具备统一计算能力的“单台计算机”形态,以满足大模型时代的超大规模并行训练需求。由于提供的原文摘要信息不足,关于具体的互联协议、拓扑结构及软件栈支持等详细技术细节有待进一步查阅。

阅读原文 ↗推荐理由:聚焦华为在万卡级/千卡级超节点集群互联架构上的工程探索,对国产算力基础设施演进具有参考价值。# 华为# 超节点# 算力# 集群互联# 芯片
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

vLLM 推出文本水印功能实现方案

开源大模型推理框架 vLLM 介绍了其内置的文本水印实现方案。该方案采用保持分布特性的 Gumbel-max 文本水印技术,结合高效的 GPU 内核优化与统计学检测方法,并支持推测解码(speculative decoding)等高级推理加速特性。通过系统级工程优化,vLLM 在保障模型生成质量与推理吞吐效率的同时,为 AI 生成内容提供了可靠的水印嵌入与溯源能力。

阅读原文 ↗推荐理由:主流推理框架 vLLM 实现了兼顾推理性能与生成质量的原生文本水印方案,对大模型工程落地与内容合规具有参考价值。# vLLM# 文本水印# 大模型# 芯片# 安全
9月23日2026-09-23
Ollama 更新AI 评分 55/10008:53

开源项目发布 v0.34.4-rc0:通过 MLX 算子优化加速 Qwen 3.8 Prompt 处理

在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。

阅读原文 ↗推荐理由:展示了基于 MLX 框架对 Qwen 模型的算子融合与长序列处理加速的具体工程实践。# MLX# Qwen# 推理# 芯片# 开源
9月22日2026-09-22
NVIDIA Developer Blog✦ 精选AI 评分 75/10021:00

英伟达发布DLSS 5:引入3D引导神经渲染,升级ACE与RTX套件功能

英伟达面向游戏开发者发布系列技术更新,推出DLSS 5并引入DLSS 3D引导神经渲染(3D-Guided Neural Rendering)及精细化控制功能,旨在帮助开发者在保持渲染性能的同时,呈现逼真的光照效果和材质细节。此外,本次更新还涵盖了NVIDIA ACE(虚拟数字人技术)的最新进展以及RTX Kit套件的新功能增强。

阅读原文 ↗推荐理由:英伟达发布全新DLSS 5技术及图形渲染重大更新,对游戏开发与图形渲染生态具有重要影响。# 英伟达# 计算机视觉# 端侧AI# 芯片
Equinix Blog · 互联基础设施AI 评分 45/10019:55

面对快速迭代的市场,企业该如何选购 AI 硬件算力

在 AI 硬件处理器市场日新月异的背景下,企业在采购算力基础设施时面临选型挑战。该内容回顾并探讨了针对 AI 硬件处理器的选型指南,深入对比了 GPU、CPU 等不同处理器的架构特点与适用场景,旨在帮助从业者在硬件迭代频繁的市场环境中理清采购思路,制定更合理的 AI 算力配置与投资策略。

阅读原文 ↗推荐理由:提供了在快速变化的芯片市场中进行 AI 硬件选型与算力采购的实用思路分析。# 芯片# 算力# 数据中心
The Next Platform✦ 精选AI 评分 60/10003:21

全球加速服务器销售增速进一步提升

行业最新动态显示,用于人工智能与高性能计算的加速服务器销售规模正在以更快的速度增长。随着全球对大模型训练与推理算力需求的持续爆发,搭载GPU、定制ASIC等加速芯片的服务器出货量与市场规模显著扩张。本条资讯基于标题信息整理,更详细的市场出货数据、厂商份额及具体增长指标等内容尚待进一步披露。

阅读原文 ↗推荐理由:反映了全球AI基础设施建设中加速计算服务器需求与出货量持续加速上行的趋势。# 算力# 数据中心# 芯片
NVIDIA · AI 筛选✦ 精选AI 评分 80/10002:00

英伟达推出DSX Ready计划,认证AI工厂电力与冷却配套产品

英伟达推出DSX Ready计划,旨在为AI工厂认证适用的电力与冷却基础设施产品。随着AI基础设施规模持续扩大,电力、制冷、水资源、场地及电网等现实限制正在深刻影响建设者的部署决策。该计划帮助数据中心建设者选择与其计算架构相匹配的完整工厂设计产品,以克服基础设施瓶颈,更高效地将计算能力转化为实际的AI产出。

阅读原文 ↗推荐理由:英伟达针对AI工厂推出基础设施认证计划,直接影响全球算力中心供电与液冷等关键配套标准。# 英伟达# 算力# 数据中心# 芯片
vLLM 官方博客(网页)✦ 精选AI 评分 68/10000:00

vllm-metal 发布:为苹果芯片带来高并发大模型推理服务支持

vLLM 官方宣布推出 vllm-metal,将 vLLM 的分页机制(PagedAttention)和连续批处理推理服务架构引入 Apple Silicon 设备。该版本旨在提升苹果芯片设备上的高并发推理能力,在面对多智能体并发负载时能提供更稳定的首字生成时间(TTFT),并支持批处理 MTP 等高级特性,优化了 Mac 设备的本地大模型部署体验。

阅读原文 ↗推荐理由:知名大模型推理框架 vLLM 拓展至苹果芯片生态,提升了本地及端侧并发推理效率。# 推理# 端侧AI# 开源# 智能体# 芯片
9月20日2026-09-20
The Next Platform✦ 精选AI 评分 70/10018:53

生成式AI热潮加速并重塑以太网交换技术格局

该文探讨了生成式人工智能(GenAI)的爆发式增长对以太网交换机市场和技术架构带来的深远变革与加速推动作用。随着大模型训练和推理对高带宽、低延迟网络互联需求的激增,以太网技术正在加速演进以适应AI算力集群的互联需求。注:原输入未提供具体正文摘要,详细的技术细节与市场分析信息不足。

阅读原文 ↗推荐理由:聚焦生成式AI大模型对数据中心以太网交换网络架构的驱动与重塑,具有行业参考价值。# 算力# 数据中心# 大模型# 芯片
9月19日2026-09-19
ServeTheHome✦ 精选AI 评分 65/10012:07

铠侠展示XL1 CXL内存扩展设备,搭载第二代XL-FLASH闪存

铠侠(Kioxia)展示了其最新推出的XL1内存扩展设备。该设备搭载第二代XL-FLASH NAND闪存技术,通过CXL高速互连接口与系统相连,可作为512GB的系统内存扩展设备使用。该技术旨在为需要高带宽、低延迟和高密度内存层级的数据中心及服务器计算平台提供新型分层存储解决方案。

阅读原文 ↗推荐理由:铠侠展示基于CXL的低延迟NAND内存扩展方案,反映了数据中心近内存与高速分层存储技术的新进展。# 铠侠# 芯片# 算力# 数据中心
9月18日2026-09-18
IT168 服务器存储 · AI与算力(网页)✦ 精选AI 评分 72/10018:13

神州鲲泰发布鲲鹏与昇腾950双芯产品矩阵,布局系统级算力

在2026华为全联接大会上,神州鲲泰正式推出基于鲲鹏与昇腾950技术路线的新一代算力产品矩阵。首批新品包括基于鲲鹏950的KunTai R722 K3均衡型服务器,以及搭载昇腾950DT的KunTai A989 I5标准服务器、KunTai A989 I5风冷超节点和KunTai PoD2000 A5液冷超节点,涵盖通用计算与AI智算集群方案,推动国产算力底座进入系统级竞争阶段。

阅读原文 ↗推荐理由:神州鲲泰依托鲲鹏与昇腾新一代芯片推出全套服务器与液冷超节点产品,展现了国产算力系统级生态的最新进展。# 算力# 芯片# 神州鲲泰# 华为
AWS News · 云基础设施✦ 精选AI 评分 60/10005:11

AWS 正式推出新一代低成本突发型 EC2 T8i 实例

AWS 宣布正式推出全新的低成本突发型 Amazon EC2 T8i 实例。该实例搭载专供 AWS 的定制第六代英特尔至强可扩展处理器(代号 Granite Rapids)。作为 AWS 成本最低的 EC2 实例类型之一,T8i 实例相比上一代 T3 实例实现了最高达 30% 的性价比提升,适用于微服务、低流量网站及开发测试等轻量突发型工作负载。

阅读原文 ↗推荐理由:AWS 推出了搭载英特尔最新 Granite Rapids 定制处理器的低成本突发型云算力实例,性价比提升明显。# 算力# 芯片# AWS# 英特尔# 数据中心
9月17日2026-09-17
IT168 服务器存储 · AI与算力(网页)✦ 精选AI 评分 88/10020:20

华为发布全球首个采用NPO技术的昇腾960超节点

在华为全联接大会2026上,华为副董事长、轮值董事长汪涛发表主题演讲,正式发布全球首个采用近封装光学(NPO)技术的超节点——昇腾960超节点。该超节点旨在突破互联瓶颈,大幅提升集群算力效率,为十万亿参数规模的超大模型训练与推理任务提供强大的算力基础设施支持,加速智能世界的底座构建。

阅读原文 ↗推荐理由:华为推出首款基于NPO光互连技术的昇腾超节点,面向十万亿参数大模型落地,具有重要的国产算力风向标意义。# 华为# 算力# 光互连# 芯片# 大模型
Data Center Knowledge✦ 精选AI 评分 65/10017:00

“僵尸负载”困扰数据中心能效,AI时代亟需新型资源清理机制

在数据中心运营中,被遗弃的作业、实例和存储卷等“僵尸负载”往往会无限期闲置运行,严重消耗电力并削弱整体运营效率。尽管现有的FinOps(云财务管理)工具能够提供一定支持,但在GPU时代的大规模AI工作负载下,传统的资源监测方式已难以满足需求,行业亟需开发全新的清理与管控方法以优化算力资源利用。

阅读原文 ↗推荐理由:探讨了AI与GPU时代下数据中心“僵尸负载”对能效与资源的消耗问题,对算力基础设施运维管理具有参考价值。# 数据中心# 算力# 芯片
9月16日2026-09-16
The Next Platform✦ 精选AI 评分 65/10023:36

Infleqtion与英伟达合作降低量子计算物理-逻辑量子比特比例

量子技术公司Infleqtion与英伟达(NVIDIA)展开合作,成功降低了量子计算中的物理量子比特与逻辑量子比特比率。该进展旨在优化量子纠错机制,减少实现容错量子计算所需的物理硬件开销。由于提供的新闻素材信息有限,具体的技术方案、压缩比例及后续商用规划等细节有待进一步公开披露。

阅读原文 ↗推荐理由:英伟达在量子计算与纠错架构领域的最新合作探索,有助于推动容错量子计算落地。# 英伟达# 算力# 芯片
NVIDIA · AI 筛选✦ 精选AI 评分 80/10023:00

英伟达 Vera Rubin NVL72 在 MLPerf Inference v6.1 评测中首秀展现领先性能

英伟达下一代 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中正式亮相并取得领先成绩。测试强调了系统性能、基础设施高效扩展与持续软件优化对 AI 推理经济性的决定性影响:高系统性能可提升 Token 生成效率与商业收益,高效扩展能确保硬件吞吐量成比例增长并降低资源开销,持续优化则可最大化基础设施的投资回报价值。

阅读原文 ↗推荐理由:英伟达展示了下一代 Rubin 架构 NVL72 系统在权威 MLPerf 推理基准中的首发性能表现。# 英伟达# 算力# 芯片# 推理# 评测
The Next Platform✦ 精选AI 评分 60/10021:37

如何打破困扰高性能计算系统的“内存墙”瓶颈

该文章聚焦于高性能计算与算力系统中所面临的“内存墙”(Memory Wall)瓶颈挑战,探讨如何通过新型架构与技术方案突破计算核心与内存传输之间的带宽与延迟限制。由于原始输入仅提供标题、缺乏详细正文内容,具体的硬件架构创新、互连技术或算法优化等突破路径尚有待进一步信息披露。

阅读原文 ↗推荐理由:探讨解决高性能算力系统内存墙瓶颈的关键架构议题,对算力硬件发展具有参考价值。# 算力# 芯片# 数据中心
MIT Technology Review AI✦ 精选AI 评分 70/10020:47

构筑AI发展的材料基石:算力与数据中心正面临材料极限挑战

随着人工智能的爆发式增长,AI算力基础设施正逐步演变为材料科学的挑战。底层硬件材料的重要性已不亚于运行其上的算法。当前,半导体和数据中心在计算性能、热管理、电气效率和运行可靠性等方面正不断逼近物理极限,这对能够在极端条件下维持高性能的新型先进材料提出了迫切需求。

阅读原文 ↗推荐理由:探讨了AI算力扩张背景下半导体与数据中心底层材料面临的物理极限挑战。# 算力# 数据中心# 芯片
NVIDIA · AI 筛选✦ 精选AI 评分 75/10000:55

英伟达在AI Infra Summit展示Vera Rubin与DSX平台:全面优化AI工厂每瓦Token能效

在圣克拉拉举行的AI Infra Summit上,英伟达超大规模与高性能计算副总裁Ian Buck发表了关于AI工厂效率的演讲。英伟达展示了其下一代Vera Rubin架构和DSX平台的最新进展,重点阐述了如何通过提升“每瓦Token数”(Tokens Per Watt)来优化AI算力基础设施的能源效率,以应对AI数据中心不断增长的能耗挑战。

阅读原文 ↗推荐理由:英伟达高管公开阐述下一代Vera Rubin架构及AI工厂每瓦能效优化策略,对全球算力基础设施发展具有指引意义。# 英伟达# 算力# 数据中心# 芯片
NVIDIA Developer Blog✦ 精选AI 评分 68/10000:55

英伟达探讨 Groq 3 LPX 确定性执行如何驱动 Vera Rubin 架构实现高效低延迟推理

功耗已成为 AI 数据中心的关键制约因素。随着 AI 工作负载对全栈计算平台提出更高要求,计算平台的各个组件都必须最大化能效。文章探讨了在英伟达下一代 Vera Rubin 平台上,如何通过 Groq 3 LPX 风格的确定性执行机制来优化高交互性推理任务,从而在严苛的功耗限制下实现极低延迟和高能效表现。

阅读原文 ↗推荐理由:探讨了英伟达 Vera Rubin 架构下结合确定性执行技术提升高交互性 AI 推理能效的方案。# 英伟达# 算力# 芯片# 推理# 数据中心
NVIDIA Developer Blog✦ 精选AI 评分 80/10000:55

英伟达解析 NVLink 6 如何为 AI 工厂构建多层容错韧性

英伟达阐述了下一代互联技术 NVLink 6 如何为超大规模“AI 工厂”提供多层弹性与高可用保障。对于大规模 AI 训练而言,保障集群持续稳定运行是提升算力生产力的关键。NVLink 6 通过针对性设计的多层韧性机制,在庞大 GPU 集群互联中降低软硬件故障引发的训练中断风险,确保超大规模并行计算的高吞吐与业务连续性。

阅读原文 ↗推荐理由:解析了英伟达下一代互联技术 NVLink 6 在保障超大规模 AI 集群稳定训练方面的多层容错设计。# 英伟达# 算力# 数据中心# 芯片
9月15日2026-09-15
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

基于GB300 NVL72集群:Kimi-K3的高效DSpark多节点训练实践

文章介绍了针对Kimi-K3模型构建高效DSpark训练系统的技术实践。通过结合投机采样技术(Speculators)与Mooncake分布式架构,团队在GB300 NVL72算力集群上成功实现了多节点DSpark的高效扩展与训练,大幅提升了大模型训练中的吞吐表现与集群算力利用效率。

阅读原文 ↗推荐理由:展示了结合Mooncake架构与NVL72算力集群加速Kimi大模型训练的前沿工程实践。# 大模型# 算力# 芯片# 微调# 英伟达
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

Novita AI 开源 Chord:面向 Kimi K2.x 的高效 INT4 MoE 算子,推理提速最高达 2.15 倍

Novita AI 与 vLLM 社区合作开源了高性能 W4A16 MoE CUDA 算子 Chord。该算子专为 Kimi K2.x 等混合专家模型的推理服务架构优化,支持与 Humming 兼容的索引路径及 SM90 分组。基准测试显示,Chord 在英伟达 H200 芯片上可实现最高 1.3 倍的加速,在未调优的 B300 芯片上加速比达 2.15 倍,显著优化了 MoE 架构的推理性能。

阅读原文 ↗推荐理由:开源了针对热门 MoE 架构的高性能量化算子,显著提升主流及下一代 GPU 的推理效率。# 推理# 开源# 大模型# 算力# 芯片