在什么情况下,给语言模型增加验证和搜索结构反而会降低性能?
当可用token预算低于约1000至1500个输出等效token时,计划和验证的额外开销会占用答案空间,导致性能不如单次模型调用,甚至接近0%。
(翻译)思考消耗令牌:更多结构何时物有所值
Abstract page for arXiv paper 2608.27506: Thinking Costs Tokens: When More Structure is Worth the Price
本文研究在token预算受限时,为语言模型添加规划、验证和修复等推理结构的影响。作者在FinQA和TAT-QA金融推理任务上,用GPT-5.4 mini对比了单次调用与带验证搜索的架构,覆盖250至42000个输出等效token的14个预算档位。结果显示,在1000至1500 token之间存在交叉点:低于该阈值时,计划开销反而损害性能;高于该阈值后,验证搜索架构持续优于单次调用,最高准确率约44%对40%。
当可用token预算低于约1000至1500个输出等效token时,计划和验证的额外开销会占用答案空间,导致性能不如单次模型调用,甚至接近0%。
研究使用GPT-5.4 mini在FinQA和TAT-QA两个金融推理数据集上进行了实验,共测试14个预算档位和28000个完成单元。
美联储今起议息 沃什或成关键一票云岫资本合伙人宋旭文:量子计算:工程化与产业化并进,拐点将至 | 36氪 2026产业未来大会
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级
字节跳动CEO梁汝波:豆包、飞书与火山引擎整合后 将加大企业市场投入
2nm天玑9600 Pro,把旗舰SoC竞争推向「融合计算」
王强宇履新百望:从发票SaaS工具,到财税垂直大模型,再到企业的Palantir8点1氪丨8月一线城市房价上涨;携程上架510万一张的太空旅行船票;字节跳动上半年净利润出现下滑,但海外收入占比再创新高
美团发布“手艺人Agent”,发型师可“吩咐”AI小帮手打理线上作品
派早报:Steam Frame 开启预购、WPS 多端支持 Markdown 等
HYROX比赛腹泻这事,运动员拼归拼,但主办方不能装看不见
AI风口之下,明星们又想“挤上”牌桌了B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首
产品定义意义上的一级场景:四维模型
在金融支付系统中实施混沌工程:来自企业级 ECS 部署的经验教训
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?企业案例分享:坤煜量子|36氪2026产业未来大会
一年28倍妖王:谁在爆炒?把记忆交给CPU,大模型会变快圆桌:跃迁·AI深流,价值跃升——AI深水时代,从模型竞逐到产业价值涌现 | 36氪 2026产业未来大会
大促GMV猛涨500%:激光雕刻设备靠"创意落地"出海东南亚
Your Agent Aced the Task. Will It Do It Again?Firefox 156 释出
我的“一人公司”,是怎么搞钱的?从前沿技术到产业资本,2026产业未来大会看见「深水之上」被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」
月下载暴增366%,上海真人社交公司切入东南亚AI陪伴,AI角色也能“奔现”
豆包工作和飞书,把中国第一个团队 Agent 拉进了工作群
碧桂园服务与支付宝全面深化合作,共筑“智慧物业”数字化新标杆
社区速递 158 | 便宜耐造的副厂手柄与大学宿舍里那些相见恨晚的装备FAST 发现极短周期、最轻双中子星系统