传统VLA模型在长程操控中为什么会出错?
传统VLA模型采用静态特征融合,视觉、语言和动作历史的权重在整个执行过程中固定不变。早期出现毫米级定位偏差时,模型无法及时提高视觉权重来纠偏,误差逐步累积放大,导致后续步骤失败;子任务切换时也缺少对高层意图的动态调整,容易出现动作中断。

作者丨 张 璐 编辑丨 幸丽娟 &nbs
华东师范大学与上海交通大学团队提出S²-VLA模型,通过信念状态和自适应动态门控机制,让模型按任务阶段动态调整视觉、意图和动作注意力。仅2B参数、约7GB显存,即可在LIBERO-Long长程操控任务上达到96.4%成功率,超越多数7B以上大模型,同时大幅提升推理吞吐,为端侧机器人部署提供新思路。
传统VLA模型采用静态特征融合,视觉、语言和动作历史的权重在整个执行过程中固定不变。早期出现毫米级定位偏差时,模型无法及时提高视觉权重来纠偏,误差逐步累积放大,导致后续步骤失败;子任务切换时也缺少对高层意图的动态调整,容易出现动作中断。
S²-VLA引入轻量循环网络维持信念状态,实时感知任务进度和偏差,再由SSGAA模块将特征融合拆分为局部视觉、全局意图和动作自注意力三条通道。信念状态生成动态门控权重,根据当前阶段调整三条通道的占比:需要精确定位时提高视觉权重,子任务切换时提高意图权重,平稳移动时由动作自注意力主导。
S²-VLA仅用2B参数在LIBERO-Long上达到96.4%成功率,超过多个7B甚至8.5B模型。推理显存约7GB,吞吐量80.8Hz,远高于同类7B模型通常几Hz的水平,更适合端侧和工厂场景部署。
在金融支付系统中实施混沌工程:来自企业级 ECS 部署的经验教训36氪研究院 | 2026年北京市OPC创业者研究报告
耐克和lululemon双双失速,运动品牌进入碎片化时代
找不到小红书爆文选题?去淘宝差评区抄!
视频号评论区小蓝词使用指南
实习生1天消耗1亿Token被约谈:如何衡量Token的ROI
基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code
奇安信斩获国家信息安全漏洞库CNNVD两项重磅荣誉
项目汇报怎么讲,才能让领导看见你的价值?无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA前OpenAI后训练VP回应陶哲轩:说AI毁了数学,可能还是太小瞧AI了
“阿宝”交新朋友:携手比亚迪“迪迪虾”,实现车机端一句话办事
一边喊停一边敲钟:硅谷AI巨头到底在怕什么
Ctenophores Aren’t Just Beautiful. They’re Biological Wonders.FAST 发现极短周期、最轻双中子星系统Meta新研究:字节模型蒸馏后,天花板破了
CLARITY法案为何倒在参议院门口?这主流如你所愿
清晰法案有概率通过?市场可能并未定价
Your Agent Aced the Task. Will It Do It Again?
AI 写了几十页 PPT,“经营分析”报告仍被批不够深入?
510万一张!携程上架太空旅行船票:已有681人购买,还得自己买保险;娃哈哈因拖欠员工公积金被查封办公楼;华为放权!问界将由赛力斯主导
字节将发布独立智能网盘“ADrive”,腾讯网盘先已布局,网盘AI大战打响
当黄仁勋和Dario遇上休谟:火鸡、台球与AI末日论
HTTP 新增 QUERY 方法:有人叫好,也有人质疑“这不就是 GET?”
超越代币化:让RWA在链上发挥实用价值圆桌:新能源:后时代的深水淘金 | 36氪 2026产业未来大会
企业该买模型还是养上下文?
被AI放大的光学「戏份」,让「配角」舜宇的生意越做越大