AIDC
DC AI 热点

全部 AI 动态

9月24日2026-09-24
NVIDIA Developer Blog✦ 精选AI 评分 75/10023:00

面向生物基础模型的高效混合专家(MoE)训练方法

随着语言模型规模的持续扩大,扩展传统密集架构的计算成本变得愈发昂贵。在密集 Transformer 模型中,每个标记都会经过所有网络层,导致算力消耗剧增。针对这一挑战,该研究探讨了面向生物基础模型的高效混合专家(MoE)训练技术,旨在通过稀疏激活机制降低计算开销,提升大模型在生物医学等特定领域的训练效率与扩展能力。

阅读原文 ↗推荐理由:聚焦混合专家(MoE)架构在生物基础模型中的高效训练实践,对大模型轻量化与垂直领域扩展具有参考价值。# MoE# 混合专家# 生物基础模型# 模型架构# 算力
NVIDIA Developer Blog✦ 精选AI 评分 75/10006:54

NV-Reason-CT 发布:面向放射科思维链推理的开源 3D CT 视觉语言模型

虽然放射科 AI 在胸部 X 光、病理切片及 2D 影像检测中已取得显著进展,但针对临床信息更为丰富的 3D CT 影像理解仍面临挑战。为此,相关研究推出了开源 3D CT 视觉语言模型 NV-Reason-CT。该模型旨在引入放射科医生的思维链(Chain-of-Thought)推理机制,强化 AI 对三维医学断层扫描数据的深度解读与逻辑分析能力,助力复杂的临床影像辅助诊断。

阅读原文 ↗推荐理由:将思维链推理扩展至临床高难度的 3D CT 影像领域,属于多模态医疗模型架构的重要前沿进展。# 医疗AI# 视觉语言模型# 思维链# 3D影像# 开源
NVIDIA Developer Blog✦ 精选AI 评分 75/10003:45

部署AI负载前如何全面验证GPU集群就绪性

在实际运行AI工作负载前,即便GPU集群通过了各项常规健康检查(如GPU单卡、网络链路及Pod状态均显示正常),512卡等大规模分布式训练任务仍可能面临运行失败。文章指出传统的基础硬件监控无法完全保障复杂AI任务的稳定运行,强调了在正式上线AI负载前,必须对GPU集群进行深度的端到端就绪性验证,以提前排查潜在隐患。

阅读原文 ↗推荐理由:聚焦大规模GPU集群运维中的核心痛点,探讨了常规硬件检查与实际AI训练就绪之间的差距。# GPU集群# 算力# 分布式训练# 集群运维# AI训练
NVIDIA Developer BlogAI 评分 55/10002:25

NodeWright:专注于 Kubernetes 节点集群底层配置与运维管理的工具

Kubernetes 主要负责调度和管理节点上运行的工作负载,但对节点底层的运维管理仍具挑战。NodeWright 旨在解决节点自身的管理难题,涵盖内核参数调优、系统软件包安装与更新、存储布局配置以及安全代理部署等底层系统级运维需求,帮助运维团队更高效地管理 Kubernetes 节点集群基础设施。

阅读原文 ↗推荐理由:针对 Kubernetes 基础设施底层节点配置与运维管理的专用工具,具有一定工程参考价值。# Kubernetes# 算力# 节点管理# 云原生# 运维自动化
NVIDIA Developer Blog✦ 精选AI 评分 78/10000:00

SWE-Serve揭示AI编程智能体在本地测试与线上推理服务间的表现差距

该研究探讨了AI编程智能体在修改模型推理服务软件时的现实局限,并推出相关评测框架SWE-Serve。研究指出,AI智能体生成的代码补丁即使能够顺利通过本地测试,在服务器加载真实模型并处理实际服务请求时仍可能失败。该成果重点分析了针对推理服务系统进行代码评估的复杂性,指出了传统离线测试环境与真实高负载在线部署之间的关键工程脱节问题。

阅读原文 ↗推荐理由:指出了AI代码智能体在推理服务实际部署中“能过测试却无法上线”的关键痛点,对评估智能体工程能力有重要参考价值。# SWE-Serve# 智能体# 推理服务# AI编程# 评测
9月23日2026-09-23
NVIDIA Developer Blog✦ 精选AI 评分 75/10001:27

英伟达推出机密计算方案,助力实现私有高性能生产级AI推理

随着大语言模型(LLM)推理在个人、企业及受监管行业中日益广泛地处理敏感数据和专有模型上下文,隐私与安全防护变得至关重要。英伟达通过其机密计算(Confidential Computing)技术,致力于在保护数据隐私和知识产权的同时,提供生产级的高性能AI推理能力,确保大模型在云端及基础设施中的安全可靠运行。

阅读原文 ↗推荐理由:介绍了英伟达利用硬件机密计算保护大模型推理敏感数据的安全解决方案。# 英伟达# 安全# 推理# 隐私计算# 大模型
NVIDIA Developer Blog✦ 精选AI 评分 78/10001:16

英伟达推出Topograph:面向AI工厂的拓扑感知工作负载调度方案

随着AI工厂受限于功耗与互联网络瓶颈,系统最大化价值高度依赖全栈优化,其中GPU工作负载的调度放置成为核心环节。英伟达推出Topograph调度工具,通过感知底层硬件与网络拓扑结构,优化多GPU任务在集群中的分配方案,旨在消除网络通信拥塞并提升整体算力集群的运行效率与能效表现。

阅读原文 ↗推荐理由:英伟达针对AI工厂网络拓扑与功耗限制推出关键调度方案,直击大规模集群通信瓶颈与利用率痛点。# 英伟达# 算力# 数据中心
9月22日2026-09-22
NVIDIA Developer Blog✦ 精选AI 评分 75/10021:00

英伟达发布DLSS 5:引入3D引导神经渲染,升级ACE与RTX套件功能

英伟达面向游戏开发者发布系列技术更新,推出DLSS 5并引入DLSS 3D引导神经渲染(3D-Guided Neural Rendering)及精细化控制功能,旨在帮助开发者在保持渲染性能的同时,呈现逼真的光照效果和材质细节。此外,本次更新还涵盖了NVIDIA ACE(虚拟数字人技术)的最新进展以及RTX Kit套件的新功能增强。

阅读原文 ↗推荐理由:英伟达发布全新DLSS 5技术及图形渲染重大更新,对游戏开发与图形渲染生态具有重要影响。# 英伟达# 计算机视觉# 端侧AI# 芯片
NVIDIA Developer Blog✦ 精选AI 评分 70/10020:00

利用AI智能体与NVIDIA Isaac ROS加速ROS 2节点性能

GPU加速虽能提升计算密集型机器人工作负载的效率,但仅凭高效的CUDA内核并不足以确保整个ROS 2图的高性能运行。随着消息在节点之间传递,系统架构与通信开销往往成为瓶颈。本文探讨如何结合AI智能体与英伟达Isaac ROS套件,对ROS 2节点及计算图进行端到端的深度优化与性能加速,克服机器人数据流传输中的性能瓶颈。

阅读原文 ↗推荐理由:聚焦机器人操作系统ROS 2与英伟达Isaac ROS的GPU工程化加速,对具身智能开发具实用参考价值。# 具身智能# 英伟达# 智能体# 算力
NVIDIA Developer Blog✦ 精选AI 评分 72/10005:51

英伟达在Dynamo-Triton中集成TensorRT多设备推理,简化多GPU模型部署服务

随着生成式AI对计算与显存的需求不断超出单卡上限,英伟达推出TensorRT多设备推理新功能,并将其集成至NVIDIA Dynamo-Triton中。该方案旨在简化跨多个GPU的大模型推理服务部署流程,有效降低多卡分布式推理的工程复杂度,提升大规模生成式AI模型在多GPU环境下的服务效率与吞吐能力。

阅读原文 ↗推荐理由:英伟达针对多卡推理服务集成新功能,有助于降低大模型分布式推理部署的工程门槛。# 英伟达# 推理# 算力# 大模型
NVIDIA Developer Blog✦ 精选AI 评分 70/10005:05

如何评估AI智能体:从工具调用到任务完成的全流程解析

在部署和应用AI智能体时,核心挑战在于验证其能否在真实运行环境中,通过连续数十次工具调用顺畅执行一系列复杂工作流,并最终准确完成任务。本文探讨了评估AI智能体端到端表现的关键方法与指标,重点聚焦于智能体在多步调用链中的鲁棒性、环境交互能力及任务达标率的系统性评测框架。

阅读原文 ↗推荐理由:系统性阐述了AI智能体从底层工具调用到高层任务闭环的评估方法,对智能体落地工程实践具有参考价值。# 智能体# 评测# AI编程
9月21日2026-09-21
NVIDIA Developer Blog✦ 精选AI 评分 68/10023:00

利用英伟达 Earth-2 平台将最新观测数据转化为及时气象决策

气象敏感型行业如今能够获取更具前瞻性和局部化的环境变化观测数据。英伟达通过 Earth-2 气候数字孪生平台,帮助能源等行业整合最新观测数据并实现高精度的天气模拟与预测,从而在气候变化加剧的背景下辅助企业优化运营、评估灾害风险并制定更及时的业务决策。摘要信息有限,主要展示了该技术在气象敏感领域的赋能潜力。

阅读原文 ↗推荐理由:展示了英伟达 Earth-2 数字孪生平台在能源与气象预测领域的具体行业落地应用。# 英伟达# Earth-2# 时间序列# 大模型
9月19日2026-09-19
NVIDIA Developer Blog✦ 精选AI 评分 68/10003:04

使用 AIPerf 对大规模大语言模型推理进行基准评测

在系统上部署大语言模型后,评估其实际推理速度与性能表现是关键难题。本文介绍了用于大规模大模型推理评测的工具 AIPerf,旨在帮助开发者和工程师摆脱直觉猜测,建立系统化、规模化的性能基准测试方法,准确衡量模型在不同负载下的响应速度与吞吐能力。

阅读原文 ↗推荐理由:介绍了大语言模型规模化推理基准测试工具 AIPerf,对模型部署与性能调优具备实用参考价值。# 大模型# 推理# 评测# 算力
9月17日2026-09-17
NVIDIA Developer Blog✦ 精选AI 评分 68/10007:20

如何利用AI智能体构建与验证用于物理仿真的3D场景

文章介绍了如何将AI智能体工作流应用于物理AI系统的数字孪生准备与验证中。通过智能体工作流,AI能够自动巡检并解析3D场景,生成和编辑仿真所需的关键数据,从而大幅提升物理仿真环境的搭建效率,为具身智能与机器人等物理AI系统的训练与测试提供高质量的数字孪生支撑。

阅读原文 ↗推荐理由:探讨了AI智能体在构建物理仿真与数字孪生场景中的实用落地流程。# 智能体# 具身智能# 多模态# 计算机视觉
NVIDIA Developer Blog✦ 精选AI 评分 78/10004:37

英伟达 TensorRT Edge-LLM 在 Jetson AGX Thor 上实现 MLPerf 边缘智能体基准 6.4 倍加速

英伟达公布最新测试结果,TensorRT Edge-LLM 在 Jetson AGX Thor 平台上运行 MLPerf 边缘智能体基准测试时实现了 6.4 倍的速度提升。随着 AI 智能体逐步从云端数据中心迁移至汽车、机器人及其他边缘硬件,该技术针对需要多步骤推理的智能体工作流进行了优化,显著提升了端侧设备本地处理复杂任务的能力与能效表现。

阅读原文 ↗推荐理由:展示了英伟达下一代 Jetson Thor 平台在边缘端与具身硬件上加速运行 AI 智能体的性能突破。# 英伟达# 端侧AI# 智能体# 推理# 具身智能
NVIDIA Developer Blog✦ 精选AI 评分 72/10000:28

基于智能体 AI 实现 CUDA Tile 操作从 Python 到 Rust 的转换

该项目介绍了 cuTile Rust(cutile-rs),这是一个用于在 Rust 编程语言中安全、规范编写 GPU 内核的基于 Tile 的系统。研究探讨了利用智能体 AI(Agentic AI)技术,将 Python 中的 CUDA Tile 操作自动转换并适配至 Rust,将 Rust 的所有权和类型安全机制扩展到高性能 GPU 算子开发中。

阅读原文 ↗推荐理由:展示了利用智能体 AI 进行底层高性能 GPU 内核代码跨语言迁移与安全编程的工程实践。# 智能体# AI编程# 算力# 开源
9月16日2026-09-16
NVIDIA Developer Blog✦ 精选AI 评分 75/10001:00

稠密模型与MoE架构对比:激活参数、吞吐量与选型策略解析

文章深入探讨了稠密(Dense)模型与混合专家(MoE)模型的核心差异,重点解析了激活参数量、推理吞吐量以及不同应用场景下的选型策略。文中以 Nemotron 3.5 Lightning 为例,剖析了总参数量达 30B 的模型如何通过每个 Token 仅激活 3B 参数,既保持了大模型的表征能力又大幅提升了计算效率,为开发者在算力受限下权衡推理成本与模型表现提供了系统指导。

阅读原文 ↗推荐理由:系统对比了 Dense 与 MoE 架构的运行机制与吞吐性能,为大模型推理优化与架构选型提供实用参考。# 大模型# 推理# 算力# 英伟达
NVIDIA Developer Blog✦ 精选AI 评分 68/10000:55

英伟达探讨 Groq 3 LPX 确定性执行如何驱动 Vera Rubin 架构实现高效低延迟推理

功耗已成为 AI 数据中心的关键制约因素。随着 AI 工作负载对全栈计算平台提出更高要求,计算平台的各个组件都必须最大化能效。文章探讨了在英伟达下一代 Vera Rubin 平台上,如何通过 Groq 3 LPX 风格的确定性执行机制来优化高交互性推理任务,从而在严苛的功耗限制下实现极低延迟和高能效表现。

阅读原文 ↗推荐理由:探讨了英伟达 Vera Rubin 架构下结合确定性执行技术提升高交互性 AI 推理能效的方案。# 英伟达# 算力# 芯片# 推理# 数据中心
NVIDIA Developer Blog✦ 精选AI 评分 80/10000:55

英伟达解析 NVLink 6 如何为 AI 工厂构建多层容错韧性

英伟达阐述了下一代互联技术 NVLink 6 如何为超大规模“AI 工厂”提供多层弹性与高可用保障。对于大规模 AI 训练而言,保障集群持续稳定运行是提升算力生产力的关键。NVLink 6 通过针对性设计的多层韧性机制,在庞大 GPU 集群互联中降低软硬件故障引发的训练中断风险,确保超大规模并行计算的高吞吐与业务连续性。

阅读原文 ↗推荐理由:解析了英伟达下一代互联技术 NVLink 6 在保障超大规模 AI 集群稳定训练方面的多层容错设计。# 英伟达# 算力# 数据中心# 芯片