Gemma 4 登陆 Cerebras:以超 1,800 tokens/s 实现极速多模态推理
Cerebras 宣布在其算力平台上支持 Gemma 4 31B 模型,推理生成速度超过每秒 1,800 个 token,将其超高速推理能力拓展至多模态领域。开发者可依托该低延迟算力支持,构建高响应速度的计算机视觉、文档解析、屏幕截图识别以及智能体(Agentic AI)工作流,显著提升端到端交互效率。
推荐理由展现了 Cerebras 晶圆级算力架构在大模型推理加速上的极高吞吐性能,拓展了多模态实时推理边界。
原标题:Gemma 4 on Cerebras—The Fastest Inference is Now Multimodal
阅读 Cerebras 官方博客(网页) 原文 ↗