VLM-AR3L 是如何解决大模型高频调用带来的高成本和延迟问题的?
研究团队让大模型在后台从经验回放池中离线采样图像对并生成偏好标签,再用这些标签训练一个极小的本地孪生网络。强化学习训练时只调用本地轻量网络获取奖励,从而将大模型API查询需求降低约20倍。

作者丨 张 璐 编辑丨 幸丽娟 &nbs
清华与NVIDIA联合团队在《VLM-AR3L》研究中,将Gemini 2.0、GPT-4.1等主流视觉语言模型放入《我的世界》等具身仿真环境进行动作评估测试。结果显示Gemini 2.0综合最稳,开源小模型在部分任务上反超。针对直接调用大模型作为奖励信号存在的成本高、绝对打分漂移等问题,团队提出绝对加相对双奖励与孪生网络蒸馏框架,将查询开销降至1/20,并在长时程任务中超越人类手写奖励。
研究团队让大模型在后台从经验回放池中离线采样图像对并生成偏好标签,再用这些标签训练一个极小的本地孪生网络。强化学习训练时只调用本地轻量网络获取奖励,从而将大模型API查询需求降低约20倍。
Gemini-2.0-Flash 是唯一在所有10项任务中准确率全部保持在70%以上的模型,综合表现最稳,部分任务准确率超过90%。
一是奖励评估会发生剧烈漂移,训练后期评分基准不稳定;二是对于循环或非线性动作,如环形跑道任务,全局固定的高低分在数学上不成立,会导致智能体陷入死循环,收益始终为0。
亚太唯一!腾讯云首次入选IDC MarketScape 全球托管边缘服务领导者类别FAST 发现极短周期、最轻双中子星系统
“极端”空头压境 美联储周三不加息就是最大意外
Stella:“显化”想要的人生,60天35万美元月收入高性能电动船艇动力系统公司获近亿A轮融资,海外收入增长450%丨36氪首发
OpenAI故意欠技术债,等Codex来还:仅2名工程师,把核心存储从Python重写成Rust
豆包工作还想反超WorkBuddy?
强化学习大本营新作:如何破解「学新忘旧」困局美国军方首次证实在太空部署了武器
CoinEx宣布体面关停:值得肯定但不该神化
字节将发布独立智能网盘“ADrive”,腾讯网盘先已布局,网盘AI大战打响
Anew Labs已完成 2.9 亿美元融资,红杉中国、高瓴、IDG、五源、高榕等参与
现在参与以太坊原生质押为什么要先排队一个月?企业案例分享:伊辛智能|36氪2026产业未来大会8点1氪丨8月一线城市房价上涨;携程上架510万一张的太空旅行船票;字节跳动上半年净利润出现下滑,但海外收入占比再创新高
Robinhood的财富效应AI大模型工场2026 AI产业生态大会今日举办,大咖同台共探智能生长与产业共生
豆包工作打出“团队Agent”牌,Workbuddy、千问会跟吗?
当我怀念旧版 Edge 浏览器时,我在怀念什么?
Scaling Federated Learning Across Docker, Kubernetes, and Slurm with NVIDIA FLARE圆桌:探路·产业分工的新图谱,看到新未来——国家力量如何转化为产业价值 | 36氪 2026产业未来大会
上市前交易市场:永续合约化的Pre-IPO资产首个AIGC长片大赛!RunningHub单项大奖100万,科幻IP免费改编
展翼之后,三折叠再次进化:HUAWEI Mate XT 2 非凡大师深度体验评测
横扫四榜,DM0.5 凭什么面面俱到?Optimizing cost and latency with Amazon Bedrock prompt caching
电商对账的设计逻辑:四层核对,逐层下钻Build an AI-powered product tagging system with Amazon SageMaker serverless model customization圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会
iOS 27 正式版体验:Siri AI 终于开窍了,老 iPhone 升级也有新东西