提示缓存能带来多大的成本节省?
缓存命中的输入 token 成本比标准输入低 90%,缓存写入 token 则高 25%,1 小时 TTL 的写入成本为标准输入的两倍。对重复上下文的工作负载,输入 token 成本净节省约 75%。
(翻译)使用 Amazon Bedrock 提示缓存优化成本与延迟
Prompt caching in Amazon Bedrock can cut input token costs by up to 90% when you repeatedly send the same context to foundation models. This post walks through six practical prompt caching scenarios using the Converse API: message content, system prompt, tool definition, mixed TTL, tenant isolation,
本文介绍 Amazon Bedrock 提示缓存机制,通过 cachePoint 标记复用重复上下文,缓存命中的输入 token 成本可降低约 90%,并减少首 token 延迟。文章给出消息内容、系统提示、工具定义、混合 TTL、租户隔离及 LangChain 集成六个实践场景,并说明缓存作用域、token 阈值、TTL 与计费规则,附带完整可运行示例代码。
缓存命中的输入 token 成本比标准输入低 90%,缓存写入 token 则高 25%,1 小时 TTL 的写入成本为标准输入的两倍。对重复上下文的工作负载,输入 token 成本净节省约 75%。
需在请求中加入 cachePoint 标记,且标记前的内容需达到最低 token 阈值,例如 Claude Sonnet 4.5 与 4.6 为 1024 token,Opus 模型为 4096 token。缓存按 AWS 账号和区域隔离,默认 TTL 为 5 分钟,部分模型支持最长 1 小时。
共六种,从基础到进阶:消息内容缓存、系统提示缓存、工具定义缓存、混合 TTL 缓存、多租户缓存隔离以及 LangChain 框架集成。
早报|雷军同日到访宇树与B站/罗永浩差评带来流量,野人先生单日涨粉近3万/鸿蒙智行确认问界合作调整,赛力斯主导
Anew Labs已完成 2.9 亿美元融资,红杉中国、高瓴、IDG、五源、高榕等参与一款在浏览器里运行、部署在自己服务器上的 SQL 客户端
美联储今起议息 沃什或成关键一票
电商对账的设计逻辑:四层核对,逐层下钻
对话蚂蚁灵波 CEO 朱兴:机器人还吃不了「粗粮」企业案例分享:伊辛智能|36氪2026产业未来大会
Uniswap v4上的恶意Hooks圆桌:新能源:后时代的深水淘金 | 36氪 2026产业未来大会
Python 拥抱 RISC-V:CPython 正式纳入 Tier 3 平台手机替我跑了一整套流程!我就说了一句话,AI执行了100步
特朗普“一再让步”:美国加密法案仍未过关
牛市的钱:是熊市里守出来的
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点
Anthropic CEO自爆行业黑幕
Building AI to accelerate science and improve lives商用割草机器人完成数千万融资,用L4级无人驾驶重构高尔夫草坪运维|硬氪首发华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下
视频号评论区小蓝词使用指南
Grayscale:比特币能否优化私募市场投资组合?
号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么
Arc主网上线 生态内有哪些项目?
豆包 2.1 Pro模型更新,已接入豆包工作
比 MEGA Home 便宜 14 万!理想 i9 Home 上市定价 36.98 万元,六座旗舰变天了
大促GMV猛涨500%:激光雕刻设备靠"创意落地"出海东南亚
How NVIDIA Groq 3 LPX Deterministic Execution Drives Power-Efficient High-Interactivity Inference on NVIDIA Vera Rubin
微信桌面端变“三折叠”,可能是在给小微腾位置