AIDC
DC AI 热点

全部 AI 动态

9月22日2026-09-22
AWS 机器学习✦ 精选AI 评分 65/10023:17

结合 Agentforce 与 AWS MCP 扩展公共部门智能数据处理能力

公共部门机构日常需处理大量如执法记录仪视频和扫描文档等非结构化证据。本文介绍了如何将 Amazon Bedrock 数据自动化与模型上下文协议(MCP)相结合,将这些非结构化多模态数据转化为结构化洞察,并通过自然语言在 Salesforce Agentforce 智能体平台中实现无缝查询与交互分析。

阅读原文 ↗推荐理由:展示了 AWS Bedrock、MCP 协议与 Salesforce Agentforce 在企业级非结构化数据处理场景下的集成应用实践。# 智能体# MCP# AWS# 多模态
vLLM 更新✦ 精选AI 评分 75/10013:20

大模型推理框架发布 v0.30.0 版本:新增 DeepSeek-V4.1、GLM-5.3 等多款模型及优化支持

开源大模型推理框架发布 v0.30.0 版本更新,包含来自 315 位贡献者的 762 次提交。新版本支持了多款前沿大模型及架构优化,包括支持 MXFP8 格式 KV 缓存与 FlashMLA 的 DeepSeek-V4.1-Flash、支持 ROCm 与 LoRA 的 DeepSeek-V4-Flash-Vision-Exp、支持 EPLB 的 GLM-5.3-Flash,以及 K2-Horizon、Cohere Compass、Bailing V3 VL 等,并引入了基于 AVX512/AMX 的 CPU 后端支持。

阅读原文 ↗推荐理由:包含 DeepSeek-V4.1、GLM-5.3 等最新模型的推理支持及 FlashMLA、MXFP8 等底层算力优化特性。# 大模型# 推理# 开源# 算力# 多模态
9月21日2026-09-21
OpenAI 官方动态AI 评分 40/10020:00

Higgsfield AI 借助 GPT-6 Astra 单日交付视频新功能

AI 创企 Higgsfield AI 借助名为 GPT-6 Astra 的模型,据称在一天之内便上线了全新视频功能。该功能主要面向小型企业,旨在简化视频广告制作流程,并加速创新创意工具的推向市场。原素材信息较为有限,未披露该模型的技术细节或更深入的实现机制。

阅读原文 ↗推荐理由:展示了生成式模型加速视频广告应用功能开发与落地的案例,但信息量相对有限。# 多模态# 大模型# 计算机视觉
9月19日2026-09-19
AWS 机器学习✦ 精选AI 评分 75/10000:52

Moonshot AI 的 Kimi K3 模型正式上线 Amazon Bedrock

Moonshot AI(月之暗面)开发的 Kimi K3 模型现已在 Amazon Bedrock 上线。该模型为开放权重架构,专为编程与知识工作场景优化。Kimi K3 具备原生视觉理解能力,支持高达 100 万 token 的上下文窗口,并提供显式提示词缓存(Prompt Caching)功能,可有效降低推理延迟与输入成本。

阅读原文 ↗推荐理由:国内头部大模型 Kimi K3 登陆亚马逊云 Bedrock,展现了国产大模型的出海与云生态落地进展。# 大模型# 多模态# AI编程# 提示词工程# 开源
9月18日2026-09-18
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

利用 PyNvVideoCodec 与 vLLM 实现多 GPU 视频字幕生成扩展

本文介绍了如何结合使用英伟达硬件视频解码库 PyNvVideoCodec 与大模型推理引擎 vLLM,在多 GPU 环境下实现视频字幕生成与视频描述任务的高效扩展。该方案通过硬件级视频解码加速数据预处理流程,有效解决了多模态视频理解任务中的数据吞吐瓶颈,提升了多卡并行推理的整体效率与性能表现。

阅读原文 ↗推荐理由:介绍了结合 PyNvVideoCodec 硬件解码与 vLLM 加速视频多模态模型多卡推理的工程实践方案。# 多模态# 推理# 英伟达# 算力# 计算机视觉
9月17日2026-09-17
NVIDIA Developer Blog✦ 精选AI 评分 68/10007:20

如何利用AI智能体构建与验证用于物理仿真的3D场景

文章介绍了如何将AI智能体工作流应用于物理AI系统的数字孪生准备与验证中。通过智能体工作流,AI能够自动巡检并解析3D场景,生成和编辑仿真所需的关键数据,从而大幅提升物理仿真环境的搭建效率,为具身智能与机器人等物理AI系统的训练与测试提供高质量的数字孪生支撑。

阅读原文 ↗推荐理由:探讨了AI智能体在构建物理仿真与数字孪生场景中的实用落地流程。# 智能体# 具身智能# 多模态# 计算机视觉
9月16日2026-09-16
Simon Willison✦ 精选AI 评分 75/10006:47

Google推出Gemini 3.8 Live语音模型,支持实时双向语音交互

Google发布了Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款新型语音到语音(speech-to-speech)大模型,对标OpenAI的GPT-Live系列。开发者通过其WebSocket API构建了轻量级Web端体验工具,用户可在浏览器中选择模型、预设声音及系统提示词,体验支持随时打断的低延迟实时双向语音对话。

阅读原文 ↗推荐理由:Google推出新一代实时语音大模型Gemini 3.8 Live,展示了低延迟语音双向交互与打断能力。# 大模型# 语音# 多模态# Google# 推理
Google DeepMind✦ 精选AI 评分 75/10001:05

Gemini 3.8 Live 与 3.8 Live Extended Thinking 模型正式发布

该动态宣布推出 Gemini 3.8 Live 以及具备扩展思考能力的 Gemini 3.8 Live Extended Thinking 新模型。由于输入素材仅包含标题,具体的技术架构细节、性能评测基准以及实际功能特性等详细信息尚待进一步披露。

阅读原文 ↗推荐理由:发布了具备扩展思考与实时交互能力的新一代 Gemini 系列模型。# 大模型# 推理# 多模态# Google
Google AIAI 评分 10/10000:00

面向多语言环境的普及化人工智能愿景展示

该素材内容极其简略,仅包含一段展示多种不同语言词汇缓缓放大掠过的动画描述,标题表达了将人工智能普及至全球各种语言使用者的愿景。由于缺乏具体技术细节、发布产品或实施方案的描述,实际有效信息严重不足。

阅读原文 ↗推荐理由:内容仅为简短动画描述且缺乏具体事实信息,价值较低。# 自然语言处理# 多模态