这篇论文主要研究什么问题?
论文研究大语言模型在长序列依赖工具调用中能否精确携带中间状态,通过让模型分步计算MD5哈希来隔离测试其状态追踪能力。
(翻译)大语言模型中的长程状态追踪:通过深层依赖工具调用序列执行 MD5
Abstract page for arXiv paper 2609.00012: Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
该研究提出一种新方法,让大语言模型通过196次依赖工具调用逐步计算MD5哈希,以纯净评估其长程状态追踪能力。实验表明,gpt-oss-120b在多数运行中能完整携带状态并返回正确摘要。研究还发现,将模型自身推理保留在上下文中以及对具备思考能力的worker进行投票,是决定成功的关键因素。
论文研究大语言模型在长序列依赖工具调用中能否精确携带中间状态,通过让模型分步计算MD5哈希来隔离测试其状态追踪能力。
模型需执行196次依赖工具调用,分64轮携带四个32位字(a,b,c,d)逐步计算MD5,且与RFC 1321标准逐位对齐验证结果。
两个关键因素是不改变权重:将模型自身推理保留在上下文中,以及对具备思考能力的worker进行投票以消除模运算错误。
字节跳动CEO梁汝波:豆包、飞书与火山引擎整合后 将加大企业市场投入
AMC 炮轰 Robinhood:股票归谁做主?
实测豆包新模型2.1-pro,这次审美和长时间Agent任务都追上第一档了
黄仁勋再谈AI危险论:中国会成为全球开源重要力量廉价太阳能改变世界能源格局Optimizing cost and latency with Amazon Bedrock prompt caching产品已批量进入全球头部Tier 1产线,「知来具身」要为工业场景打造“开箱即用”的泛化机器人
找不到小红书爆文选题?去淘宝差评区抄!
当年救了臭氧层的功臣,现在变成了永久性污染物
129亿美元卖身英伟达之后,是时候重新理解Hugging Face了
二次元“赛博分身”撬动日本市场:玩家“沉默”的AI陪伴产品,凭什么次留60%?
具透 | Liquid Glass 设计改进、性能提升……iPadOS 27 中值得一瞥的新特性
iPhone 18 Pro & Duo 首发评测,提升最大的是「充电」和这个…
How NVIDIA Groq 3 LPX Deterministic Execution Drives Power-Efficient High-Interactivity Inference on NVIDIA Vera Rubin
亚太唯一!腾讯云首次入选IDC MarketScape 全球托管边缘服务领导者类别
「沃什时代」首次加息要来了?华尔街算好了三种剧本
字节将发布独立智能网盘“ADrive”,腾讯网盘先已布局,网盘AI大战打响
Ctenophores Aren’t Just Beautiful. They’re Biological Wonders.圆桌:CVC的全面崛起 | 36氪 2026产业未来大会
Uniswap v4上的恶意Hooks
金色Web3.0日报 | 黄仁勋批驳「AI末日论」
从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海
美团发布“手艺人Agent”,发型师可“吩咐”AI小帮手打理线上作品
企业该买模型还是养上下文?
长期利率为何不愿下跌?B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首
GPT Image 2.5 对比实测:变化与局限
旧消费品,正长出新生意芯视界创始人、董事长兼首席科学家鲍捷:十年产业实践,量子感知芯片为物理AI打开物质世界 "感知入口" | 2026年36氪产业未来大会