KV Cache为什么会拖慢大模型推理?
会话历史越长,缓存占用的显存越多;显存装不下时部分缓存会被清理,下一轮需要时就要重新做Prefill,用户等待首个Token的TTFT随之增加。
让GPU去忙生成Token
量子位报道,AI Agent长时间运行会让KV Cache在显存中不断膨胀,缓存被清走后需重新Prefill,导致首Token等待时间TTFT上升并浪费GPU算力。文章以Qwen3-8B推演每Token约147KB的缓存开销,介绍以存代算的分层卸载思路,以及英特尔围绕KV Cache提出的KV Shrink、KV Fuse、KV Cascade、KV Infinity四个方向,其中KV Shrink结合QAT硬件压缩,在测试中实现空间节省约20%至30%。
会话历史越长,缓存占用的显存越多;显存装不下时部分缓存会被清理,下一轮需要时就要重新做Prefill,用户等待首个Token的TTFT随之增加。
它把分层缓存管理与QAT硬件压缩结合,并提供冷热调度API;通过重新排列KV Cache存储格式,压缩节省的空间从10%以上提升到20%至30%,且为无损压缩。
显存还要存放模型权重和运行时数据,缓存占得越多,能同时服务的请求就越少,因此需要在保存、搬运和重算之间寻找平衡。
CLARITY法案投票失败 加密监管立法再度搁浅协同办公进入Agent时代,飞书+豆包工作跑在了最前面36氪首发 | 国内头部硅电容IDM企业融资亿元,切入AI芯片与高端光模块
CLARITY法案未通过程序性表决 OpenAI拟IPO前融资高性能电动船艇动力系统公司获近亿A轮融资,海外收入增长450%丨36氪首发廉价太阳能改变世界能源格局支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎
Java新闻汇总:Simple JSON API、GlassFish、Jakarta EE、JNoSQL和Open Liberty、LangChain4j
超越代币化:让RWA在链上真正有用
微软 CEO 纳德拉:AI 应用的机会正在变大,模型成本将继续下降
我的“一人公司”,是怎么搞钱的?
芯片从业者拆解OpenAI造芯,还能再快3个月?
月下载暴增366%,上海真人社交公司切入东南亚AI陪伴,AI角色也能“奔现”
上市前交易市场:永续合约化的Pre-IPO资产
vivo Buds Clip 体验:42 小时续航的无感佩戴,音质好也舒服
YC 最值钱的这 20家公司,没有一家来自最近5年
CLARITY折戟 多方博弈撕裂行业预期 市场怎么看?
旧消费品,正长出新生意
「沃什时代」首次加息要来了?华尔街算好了三种剧本时光机器遭遇大规模机器流量一张GPU跑10万原子!分子之心用AI把化学反应“拍”成了电影
AI没有泡沫 只有割裂
视频号评论区小蓝词使用指南
穿透查询怎样升级为穿透管控?无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA
一边喊停一边敲钟:硅谷AI巨头到底在怕什么
比 MEGA Home 便宜 14 万!理想 i9 Home 上市定价 36.98 万元,六座旗舰变天了
HIP-3:昂贵的入场券 买不来的护城河
Grayscale:比特币能否优化私募市场投资组合?