查询感知压缩如何降低 RAG 成本?
在检索后使用较小模型过滤与查询相关的文本块,只将相关片段发送给主模型,从而减少主模型处理的输入令牌数,降低推理成本。
(翻译)通过查询感知压缩降低 Amazon Bedrock 上的 RAG 成本
Input tokens are often a meaningful part of the cost of running Retrieval Augmented Generation (RAG) at scale. This post describes a query-aware context compression pattern on Amazon Bedrock: after retrieval, a smaller model filters retrieved chunks against the query before the primary model answers
本文介绍了在 Amazon Bedrock 上通过查询感知压缩降低 RAG 成本的方法。该模式在检索后、最终回答前,使用较小的模型(如 Claude Haiku)根据用户查询过滤检索到的文本块,再让主模型(如 Claude Sonnet)基于压缩后的证据生成答案,从而减少输入令牌数,降低成本并降低幻觉风险。
在检索后使用较小模型过滤与查询相关的文本块,只将相关片段发送给主模型,从而减少主模型处理的输入令牌数,降低推理成本。
需要有效的 AWS 账户、为 Lambda 函数创建 IAM 角色并添加权限,以及在 Bedrock 中启用所需的模型访问权限(如 Claude Haiku 和 Claude Sonnet)。
做了两年AI落地,我总结了这7点思考
Stella:“显化”想要的人生,60天35万美元月收入
字节跳动CEO梁汝波:豆包、飞书与火山引擎整合后 将加大企业市场投入
美国加密新规又黄了
AI风口之下,明星们又想“挤上”牌桌了英国殖民之前的澳大利亚原居民人口约 222 万
旧消费品,正长出新生意
就业率砍半,年轻人靠什么翻盘?AI时代,这三点越早做越好
强化学习大本营新作:如何破解「学新忘旧」困局英伟达带动AI数据中心大变革,中国厂商不想当边缘人
王强宇履新百望:从发票SaaS工具,到财税垂直大模型,再到企业的Palantir
GPT-6 Sol 曝光:OpenAI 要把旗舰变成大白菜
长期利率为何不愿下跌?
展翼之后,三折叠再次进化:HUAWEI Mate XT 2 非凡大师深度体验评测
苹果Siri AI上线;豆包手机助手消费版正式发布;塔克拉玛干沙漠发现两处大型地下水水源
Python 拥抱 RISC-V:CPython 正式纳入 Tier 3 平台
微信桌面端变“三折叠”,可能是在给小微腾位置
清晰法案有概率通过?市场可能并未定价
抖音上线 “免费短剧” App,短剧赛道再添一员猛将
以太坊 2026 年第二季度报告
从”边卖边补”到”准备好再卖”:产品商品化的四步闭环
这种国民鱼一直被低估、被当廉价鱼!现在才知道钙和 DHA 这么多!快试试
美团发布“手艺人Agent”,发型师可“吩咐”AI小帮手打理线上作品
美联储今起议息 沃什或成关键一票圆桌:CVC的全面崛起 | 36氪 2026产业未来大会
美股太贵 该加仓新兴市场吗?芯视界创始人、董事长兼首席科学家鲍捷:十年产业实践,量子感知芯片为物理AI打开物质世界 "感知入口" | 2026年36氪产业未来大会