MoK 的 Pull 方式相比传统 Push 有什么优势?
Pull 方式让目标 GPU 主动读取所需 token,省去了多个发送方之间的目标地址协调,并能同时利用 NVLink 双向通道,在负载不均衡时最高可提升 29% 的 NVLink 利用率,signaling 延迟从约 103 微秒降到 18 微秒。

作者丨 郑佳美 编辑丨 岑 峰 &nbs
Cursor 开源 MoE 内核 MoK,将 token 调度、跨 GPU 通信与专家计算融合进单一 GPU 内核,采用 Pull 方式替代传统 Push,将 signaling 延迟从 103 微秒降至 18 微秒。在 GB300 NVL72 上,MXFP8 前向性能最高提升 2.37 倍,端到端训练吞吐提升约 41%。这标志着 AI 应用层公司开始重写底层 GPU 内核,争夺算力主权。
Pull 方式让目标 GPU 主动读取所需 token,省去了多个发送方之间的目标地址协调,并能同时利用 NVLink 双向通道,在负载不均衡时最高可提升 29% 的 NVLink 利用率,signaling 延迟从约 103 微秒降到 18 微秒。
MoK 将 GPU SM 分为通信和计算两部分,通过 minibatch 控制一次交给专家计算的 token 数,以形成至少两个完整 wave 为边界,同时使用 Ring Token Buffer 避免显存浪费,使通信和计算高效重叠。
在 GB300 NVL72 上,相比公开基线,MoK 的 MXFP8 前向最高提升 2.37 倍,反向提升 1.78 倍;端到端训练中,512 张 GPU 上单卡吞吐从每秒 760.9 个 token 提升到 1070.2 个,约提升 41%。
从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海圆桌:探路·产业分工的新图谱,看到新未来——国家力量如何转化为产业价值 | 36氪 2026产业未来大会
清晰法案有概率通过?市场可能并未定价
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级
CLARITY闯关失败 加密市场闻声而动 政策空白谁填补
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点36氪首发 | 国内头部硅电容IDM企业融资亿元,切入AI芯片与高端光模块
AI for everyone in every language
长期利率为何不愿下跌?
芯片从业者拆解OpenAI造芯,还能再快3个月?
Python 拥抱 RISC-V:CPython 正式纳入 Tier 3 平台算力、机器人、仿真与资本,谁在定义物理AI下一个十年?|第十届全球ICT峰会回顾圆桌:CVC的全面崛起 | 36氪 2026产业未来大会实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招商用割草机器人完成数千万融资,用L4级无人驾驶重构高尔夫草坪运维|硬氪首发
以太坊 2026 年第二季度报告
理想落幕:加密行业为何集体走向同质化?夜晚睡眠光照太亮可能会损伤心脏
找不到小红书爆文选题?去淘宝差评区抄!
担心代码被拿去训练!英伟达:限制员工使用 Claude;一汽将成广汽第二大股东!南北丰田拟合并;苹果回应「iPhone 18 Pro破发」
清晰法案投票失败 后续还有机会吗?圆桌:智能向实,产业向新——AI如何进入真实世界 | 36氪 2026产业未来大会Firefox 156 释出
Arc主网上线 生态内有哪些项目?
具透 | Liquid Glass 设计改进、性能提升……iPadOS 27 中值得一瞥的新特性
想把喜欢的故事做成动画?我用 AIXTV 把《聊斋》做出来了
2人团队0融资,用AI搓的复古相机APP霸榜韩国总榜第4,还做到了3个月10亿销售额?8点1氪丨选手赛中失禁污染赛道,HYROX中国宣布整改;机构预计美股明年将暴跌21%;苹果推出Siri人工智能协同办公进入Agent时代,飞书+豆包工作跑在了最前面廉价太阳能改变世界能源格局