为什么大模型推理受内存带宽限制而非算力?
因为生成每个token都需要读取全部权重,计算开销远小于数据搬运开销,内存带宽翻倍时推理速度近乎线性提升。

存储,人工智能,内存不够 闪存来凑:AI 推理的底层逻辑正在重写 金色财经,每个人都被"内存不够"教育过。
本文探讨AI推理中内存瓶颈问题,通过AirLLM在4GB显存运行2.8万亿参数模型、Flash-MoE在12GB内存iPhone运行400B参数模型等案例,论证MoE架构与闪存流式加载可将模型从内存中解放。文章引用Apple的《LLM in a Flash》论文,指出推理速度与内存带宽近线性相关,闪存读取速度成为新瓶颈。作者认为端侧AI需求真实,技术演进压力集中在高速NVMe/UFS、NAND厂商及软硬一体整合者三条路径,并警示HBF尚未成熟。
因为生成每个token都需要读取全部权重,计算开销远小于数据搬运开销,内存带宽翻倍时推理速度近乎线性提升。
MoE将模型拆分为大量专家,每个token仅激活一小部分,配合闪存流式加载和量化,只需将激活的权重复制到内存即可运行,大幅降低内存驻留需求。
通过提升闪存读取带宽、优化数据布局和预取机制、量化压缩权重以及复用已激活神经元,目前速度与可用体验仍差一个数量级,但方向明确。
AI不断进步 不得不把才华埋葬在昨天
Meta 打造“组织第二大脑”智能体的设计思路支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎从前沿技术到产业资本,2026产业未来大会看见「深水之上」
清晰法案投票失败 后续还有机会吗?
耐克、妮维雅、谷歌的警示:品类,正在误导品牌战略!圆桌:跃迁·AI深流,价值跃升——AI深水时代,从模型竞逐到产业价值涌现 | 36氪 2026产业未来大会
做了两年AI落地,我总结了这7点思考
AI攻克世纪数学难题,顶尖数学家抱团抵制,而他们担心的并不是丢了工作
AI for everyone in every language算力、机器人、仿真与资本,谁在定义物理AI下一个十年?|第十届全球ICT峰会回顾
CoinEx宣布体面关停:值得肯定但不该神化
Anew Labs已完成 2.9 亿美元融资,红杉中国、高瓴、IDG、五源、高榕等参与
缓存不该困在一台服务器里
微信桌面端变“三折叠”,可能是在给小微腾位置豆包手机明日开卖,AI能帮你操作App了吗?
云连锁到轻连锁,品牌业务逻辑的改变7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开
Introducing Gemini 3.8 Live and 3.8 Live Extended ThinkingFAST 发现极短周期、最轻双中子星系统
读完斯坦福116页AI实施手册,我最大的感受是:别再盯着模型了把记忆交给CPU,大模型会变快
产品经理的体面,是一块不能失守的 “括约肌”前高通算法研发经理跨界AI算力板检测,获近亿元战略投资丨36氪首发
Ctenophores Aren’t Just Beautiful. They’re Biological Wonders.Announcing instance preference lists for Amazon SageMaker AI training jobs高性能电动船艇动力系统公司获近亿A轮融资,海外收入增长450%丨36氪首发
早报|雷军同日到访宇树与B站/罗永浩差评带来流量,野人先生单日涨粉近3万/鸿蒙智行确认问界合作调整,赛力斯主导
英伟达开始限制Claude使用了
旧消费品,正长出新生意