为什么给智能体注入更多记忆并不总是更好?
因为模型对指南的吸收和应用能力不同:强模型可以从完整指南集中获益,较弱模型可能被大量指南淹没,而已饱和模型几乎没有可测量的提升,所以记忆剂量需要根据模型能力校准。
(翻译)你的智能体到底需要多少记忆?

A Blog post by IBM Research on Hugging Face
IBM Research 发布博客,介绍 ALTK-Evolve 在智能体记忆规模上的研究。通过对八种模型在 AppWorld 基准上的测试,发现智能体记忆并非越多越好,需按模型能力调节:强模型适合完整指南集合,弱模型宜采用核心指南加按任务检索,已饱和模型无明显收益。检索最优方案可提升任务完成率并控制推理成本。
因为模型对指南的吸收和应用能力不同:强模型可以从完整指南集中获益,较弱模型可能被大量指南淹没,而已饱和模型几乎没有可测量的提升,所以记忆剂量需要根据模型能力校准。
对较弱模型采用固定高置信核心指南加按任务检索子集的策略,gpt-oss-120b 仅增加约 5% 的 token,任务完成率提升 16.1 个百分点;提示缓存可进一步降低生产环境成本。
它从智能体自身成功与失败的轨迹中抽取行为指南,并在推理时注入完整指南集或按任务检索的指南子集,不更新模型权重,也不需要人工标注。
超越代币化:让RWA在链上真正有用
实测豆包新模型2.1-pro,这次审美和长时间Agent任务都追上第一档了SDL3 移植到 HarmonyOS / OpenHarmony
vivo Buds Clip 体验:42 小时续航的无感佩戴,音质好也舒服美国军方首次证实在太空部署了武器和Jeff Dean押注同一方向,27岁清华助理教授创业,两个月融资数亿
推特创始人谈“AI减速”论:前沿不属于任何一家公司商用割草机器人完成数千万融资,用L4级无人驾驶重构高尔夫草坪运维|硬氪首发被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」
理想落幕:加密行业为何集体走向同质化?无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA
被AI放大的光学「戏份」,让「配角」舜宇的生意越做越大英伟达带动AI数据中心大变革,中国厂商不想当边缘人
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点
耐克、妮维雅、谷歌的警示:品类,正在误导品牌战略!Firefox 156 释出产品观察丨xTool做了一台3000元起步的激光雕刻机,难的不只是价格
DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code时光机器遭遇大规模机器流量
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?
加密行业今年最重要的一天 可能就是明天圆桌:新能源:后时代的深水淘金 | 36氪 2026产业未来大会
Ctenophores Aren’t Just Beautiful. They’re Biological Wonders.NVIDIA中国开发者日定档10月苏州,现场设认证考试与黑客松决赛地平线第1500万颗征程芯片搭载大众 ID. AURA T6,HSD V2.1 即将推出
AI for everyone in every languagePS2 Fat 使用的安全芯片在时隔 26 年被破解
在金融支付系统中实施混沌工程:来自企业级 ECS 部署的经验教训
Your Agent Aced the Task. Will It Do It Again?