Jalapeño 芯片在哪些模型上进行了跑分?
公开数据在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上进行了测试。

作者丨 郑佳美 编辑丨岑 峰  
OpenAI 公布自研推理芯片 Jalapeño 首批跑分,在多个大模型上单位功耗 Token 吞吐提升约1.5-1.9倍、延迟降低。文章对比 OpenAI、NVIDIA 和 Google 的推理硬件路线:OpenAI 采用同构灵活调度,NVIDIA 引入 Groq LPU 拆分 Prefill/Decode,Google 将 TPU 8 分为训练和推理版本,指出 AI 芯片竞争焦点正从 FLOPS 转向 Token 成本。
公开数据在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上进行了测试。
因为 Decode 阶段每次只生成一个 Token,并行度下降,但模型权重仍要读取,算术强度低,导致内存带宽成为瓶颈。
GPU 负责 Prefill,大部分 Decode 放到 LPU,Decode 中的 Attention 回到 GPU,通过 micro-batch 重叠计算和通信,用 FPGA 作为异步桥接。
黄仁勋再谈AI危险论:中国会成为全球开源重要力量
字节将发布独立智能网盘“ADrive”,腾讯网盘先已布局,网盘AI大战打响7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开
2nm天玑9600 Pro,把旗舰SoC竞争推向「融合计算」时光机器遭遇大规模机器流量华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首
GPT-6 Astra 之后,产品经理需要重新设计人在流程中的位置前OpenAI后训练VP回应陶哲轩:说AI毁了数学,可能还是太小瞧AI了
510万一张!携程上架太空旅行船票:已有681人购买,还得自己买保险;娃哈哈因拖欠员工公积金被查封办公楼;华为放权!问界将由赛力斯主导
场景越多 ≠ 产品越好,:从抽象价值到真实生活的定义结构实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招
OpenAI故意欠技术债,等Codex来还:仅2名工程师,把核心存储从Python重写成Rust
QQ 飞车 Agentic 研发转型过程中的Loop Engineering
穿透查询怎样升级为穿透管控?
Scaling Federated Learning Across Docker, Kubernetes, and Slurm with NVIDIA FLARE
耐克和lululemon双双失速,运动品牌进入碎片化时代
AI健康走进百姓餐桌,蚂蚁阿福推出AI饮食分功能
在金融支付系统中实施混沌工程:来自企业级 ECS 部署的经验教训
当年救了臭氧层的功臣,现在变成了永久性污染物
拼多多链接裂变玩法
潘功胜最新文章:深刻认识中国金融结构变迁(全文)
理想落幕:加密行业为何集体走向同质化?9月21日,深圳前海!聊聊工业AI与生态共创的下一步
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型
豆包 2.1 Pro模型更新,已接入豆包工作无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA
GPT-6 Sol要来了?OpenAI本周或迎“发布狂潮”
从200亿收购失败到650亿IPO:Figma如何用“协作”颠覆设计帝国