Qwen3.8-2.4T-A95B 的总参数量和每个 token 激活的参数量分别是多少?
该模型总参数量为 2.4T,每个 token 激活 95B 参数。
(翻译)在 NVIDIA GB300 NVL72 上提供 Qwen3.8-2.4T-A95B(2.4T 参数模型)的可配置推理服务

Alibaba released the open weights for Qwen3.8-2.4T-A95B (Qwen3.8-Max), its largest open-weight model, bringing near-frontier capabilities to the open ecosystem.
阿里巴巴开源了 Qwen3.8-2.4T-A95B(Qwen3.8-Max)权重,这是其最大的开源模型,总参数 2.4T,每个 token 激活 95B,采用细粒度 MoE 与全注意力/线性注意力混合架构,支持最长 100 万 token 上下文和 128K 输出。NVIDIA 与开源生态合作,在 GB300 NVL72 上实现每 GPU 每秒超 4K tokens、每用户每秒超 350 tokens 的 FP8 推理吞吐,并支持 SGLang、vLLM、NIM 等部署。
该模型总参数量为 2.4T,每个 token 激活 95B 参数。
无需额外调优即可实现每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的吞吐量(FP8 精度)。
支持 SGLang、vLLM、NVIDIA Dynamo 和 NVIDIA NIM 等推理栈,也可使用 NVIDIA NeMo AutoModel 进行后训练微调。
担心代码被拿去训练!英伟达:限制员工使用 Claude;一汽将成广汽第二大股东!南北丰田拟合并;苹果回应「iPhone 18 Pro破发」
牛市的钱:是熊市里守出来的
现在参与以太坊原生质押为什么要先排队一个月?
从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海
香港第一、全球第八:OSL进化背后的数字资产新格局高通技术公司携手中兴努比亚和豆包手机助手,共同推动智能手机迈入个人AI新时代
就业率砍半,年轻人靠什么翻盘?AI时代,这三点越早做越好
AI 减速还是不减速:一场周末点燃的行业与政府对垒
GPT Image 2.5 对比实测:变化与局限从前沿技术到产业资本,2026产业未来大会看见「深水之上」
具透 | Liquid Glass 设计改进、性能提升……iPadOS 27 中值得一瞥的新特性
清晰法案投票失败 后续还有机会吗?
豆包工作打出“团队Agent”牌,Workbuddy、千问会跟吗?
强化学习大本营新作:如何破解「学新忘旧」困局
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级
GPT-6 Sol要来了?OpenAI本周或迎“发布狂潮”
我的“一人公司”,是怎么搞钱的?
Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人
只会搜关键词还不够,Agent 需要一套更聪明的本地搜索
物理 AI 的大结果何时到来?
当我怀念旧版 Edge 浏览器时,我在怀念什么?英国殖民之前的澳大利亚原居民人口约 222 万36氪项目新势榜:不看包装,只看项目真实进展Build an AI-powered product tagging system with Amazon SageMaker serverless model customization
被AI放大的光学「戏份」,让「配角」舜宇的生意越做越大
穿透查询怎样升级为穿透管控?B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首
Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each