DiffusionGemma 的生成速度有多快?
在 NVIDIA H100 上每秒可生成超过 1000 个 token,在 GeForce RTX 5090 上超过 700 个 token,相比传统自回归模型最高可提升 4 倍。
(翻译)DiffusionGemma:文本生成速度最高提升4倍

An overview of DiffusionGemma, an exceptionally fast text generation model with up to 4x faster speeds.
Google DeepMind 发布开源实验模型 DiffusionGemma,基于 26B 总参数 MoE 架构(激活 3.8B),采用文本扩散方式并行生成文本块,在 NVIDIA H100 上每秒可生成超 1000 个 token,较传统自回归模型最高提速 4 倍。模型以 Apache 2.0 协议开源,面向低并发、交互式本地推理场景,支持开发者微调。
在 NVIDIA H100 上每秒可生成超过 1000 个 token,在 GeForce RTX 5090 上超过 700 个 token,相比传统自回归模型最高可提升 4 倍。
它是一个 26B 总参数的 MoE 模型,推理时仅激活 3.8B 参数,采用文本扩散机制,每次前向传播可并行生成 256 个 token,并支持双向注意力。
适合速度敏感的交互式本地推理,如行内编辑、代码填充、数学图或氨基酸序列等非线性文本结构。高并发云服务场景下自回归模型可能更高效。
Cloudflare将每天90亿次请求的JavaScript CDN迁移到其开发者平台
Scaling Federated Learning Across Docker, Kubernetes, and Slurm with NVIDIA FLARE
OpenAI 总裁最新采访:现在所有人对 AI 的预测,大概率都是错的
Robinhood的财富效应
苹果Siri AI上线;豆包手机助手消费版正式发布;塔克拉玛干沙漠发现两处大型地下水水源
数亿元!前京东副总裁“消失”4年:不造会跑的天工,他在仓库里给人形机器人“占工位”
AI 减速还是不减速:一场周末点燃的行业与政府对垒
How NVIDIA NVLink 6 Delivers Multi-Layer Resiliency for AI Factories7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开
从入门到精通,一篇文章带你入门产品经理!(2026 年最新版)
Your Agent Aced the Task. Will It Do It Again?
奇安信斩获国家信息安全漏洞库CNNVD两项重磅荣誉
WorkBuddy + 美图设计室,在对话框里就能解决办公设计任务?
Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each
百度做了一堆AI产品,却没有一个能代表百度?
产品经理的体面,是一块不能失守的 “括约肌”
黄仁勋正演讲遇特朗普突然来电:通话全程直播
就业率砍半,年轻人靠什么翻盘?AI时代,这三点越早做越好日本百岁老人人数首次超过 10 万人英伟达带动AI数据中心大变革,中国厂商不想当边缘人
自主团队被捧过头了?Simon Rohrer 直言:你们交付的根本不是产品9月21日,深圳前海!聊聊工业AI与生态共创的下一步Mistral 与 Mozilla 合作推出 Firefox Smart Window
Opus 5.2深夜上线 RSI真来了?
129亿美元卖身英伟达之后,是时候重新理解Hugging Face了
CLARITY法案投票失败 加密监管立法再度搁浅
上市前交易市场:永续合约化的Pre-IPO资产
AI健康走进百姓餐桌,蚂蚁阿福推出AI饮食分功能
企业该买模型还是养上下文?圆桌:CVC的全面崛起 | 36氪 2026产业未来大会