StreamPI与传统的VLA模型有何不同?
传统VLA主要依据单帧图像独立决策,StreamPI通过持续的多模态时序建模,让模型记住历史观测并理解状态变化,为动作决策补充时间维度。

当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。
大晓机器人联合香港大学发布StreamPI,为VLA模型引入连续时序建模能力,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,使机器人理解状态变化与时间演进。实验显示其在LIBERO、CALVIN及真实任务中显著提升时序记忆与精细操作成功率,推动具身智能从空间智能迈向时空智能。
传统VLA主要依据单帧图像独立决策,StreamPI通过持续的多模态时序建模,让模型记住历史观测并理解状态变化,为动作决策补充时间维度。
StreamPI采用流式推理,首帧编码后存入键值缓存,后续仅处理新信息并直接调用历史表示,无需重复计算整个观测窗口,且不增加额外模型参数。
从入门到精通,一篇文章带你入门产品经理!(2026 年最新版)
HIP-3:昂贵的入场券 买不来的护城河算力、机器人、仿真与资本,谁在定义物理AI下一个十年?|第十届全球ICT峰会回顾
派早报:豆包发布手机助手消费者版,绿联发布首款雷电 5 显卡坞等
微信桌面端变“三折叠”,可能是在给小微腾位置
GPT-6 Astra实现具身智能突破 中国如何打具身防卫战
Robinhood的财富效应
月之暗面:网传创始人及员工信息系恶意造谣;OpenAI 放弃今年上市;iPhone Duo炒到9万,黄牛贷款欲囤货|AI周报
Stella:“显化”想要的人生,60天35万美元月收入
CLARITY的失败 跟加密行业好坏没啥关系
关于项目交付的思考:部署是最后两公里,验收才是最后一公里
一边喊停一边敲钟:硅谷AI巨头到底在怕什么实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招
AMC 炮轰 Robinhood:股票归谁做主?
推特创始人谈“AI减速”论:前沿不属于任何一家公司Firefox 156 释出基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
GPT-6 Sol要来了?OpenAI本周或迎“发布狂潮”云岫资本合伙人宋旭文:量子计算:工程化与产业化并进,拐点将至 | 36氪 2026产业未来大会8点1氪丨8月一线城市房价上涨;携程上架510万一张的太空旅行船票;字节跳动上半年净利润出现下滑,但海外收入占比再创新高把记忆交给CPU,大模型会变快
想把喜欢的故事做成动画?我用 AIXTV 把《聊斋》做出来了
月下载暴增366%,上海真人社交公司切入东南亚AI陪伴,AI角色也能“奔现”
阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单Mozilla 报告称中国开放权重模型与美国前沿模型仅相差 4.4 个月Announcing instance preference lists for Amazon SageMaker AI training jobs
语义翻译的操作日常:把”我觉得不对”变成”机器能查”
工作流可以自我进化了,英伟达开源 SoL-Pi,每小时省13.5刀!
旗舰SoC进入融合计算时代,天玑9600 Pro首创AI原生架构!
vivo Buds Clip 体验:42 小时续航的无感佩戴,音质好也舒服