Show-o 架构的核心突破是什么?
它首次将自回归与离散扩散融合在单个 Transformer 中:处理文本理解与生成时保持自回归模式,生成图像或视频时切换到基于离散 Token 的掩码扩散模式,十几步迭代即可恢复完整视觉 Token,兼顾多模态文本建模与高效图像生成。

作者丨 张璐 编辑丨岑峰
在 ECCV 2026 上,新加坡国立大学 Show Lab 负责人寿政教授介绍了 Show-o 与 Show-2 系列多模态模型。该架构在单个 Transformer 中融合自回归预测与离散扩散生成,并通过循环一致性监督缓解具身智能的数据稀缺问题;Show-2 借助 3D Tokenizer 与时空双向注意力提升连续视频生成的连贯性,团队还自研 Q1 实时骨干网,推动云端大模型与端侧低延迟控制在机器人任务中形成闭环。
它首次将自回归与离散扩散融合在单个 Transformer 中:处理文本理解与生成时保持自回归模式,生成图像或视频时切换到基于离散 Token 的掩码扩散模式,十几步迭代即可恢复完整视觉 Token,兼顾多模态文本建模与高效图像生成。
它针对具身智能等领域的标注稀缺问题,先由理解模块为无文本描述的图像生成描述,再用该文本驱动生成模块重建图像,通过对比原图与重建图建立自监督闭环,使模型能从海量无标签视频中学习。
采用云端大模型与端侧微调模型结合的策略。云端前沿大模型规划能力强但单次决策需约 8 至 20 秒,基于开源底座微调的本地模型可实现近乎实时的低延迟控制,在双臂协作等复杂任务中成功率与响应速度更高。
谁在给我们制造 AI 焦虑
CLARITY闯关失败 加密市场闻声而动 政策空白谁填补首个AIGC长片大赛!RunningHub单项大奖100万,科幻IP免费改编
vivo Buds Clip 体验:42 小时续航的无感佩戴,音质好也舒服B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首
今晚「鸽派加息」?
2人团队0融资,用AI搓的复古相机APP霸榜韩国总榜第4,还做到了3个月10亿销售额?
清晰法案投票失败 后续还有机会吗?圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会
Python 拥抱 RISC-V:CPython 正式纳入 Tier 3 平台
AI 减速还是不减速:一场周末点燃的行业与政府对垒地平线第1500万颗征程芯片搭载大众 ID. AURA T6,HSD V2.1 即将推出
「沃什时代」首次加息要来了?华尔街算好了三种剧本
让 AI 补货,但不让它算库存——LangGraph 在生鲜补货的落地实践Firefox 156 释出Build an AI-powered product tagging system with Amazon SageMaker serverless model customizationPS2 Fat 使用的安全芯片在时隔 26 年被破解
只会搜关键词还不够,Agent 需要一套更聪明的本地搜索
Stella:“显化”想要的人生,60天35万美元月收入手机替我跑了一整套流程!我就说了一句话,AI执行了100步
项目汇报怎么讲,才能让领导看见你的价值?
OpenAI 总裁最新采访:现在所有人对 AI 的预测,大概率都是错的
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级圆桌:探路·产业分工的新图谱,看到新未来——国家力量如何转化为产业价值 | 36氪 2026产业未来大会
Arc主网上线 生态内有哪些项目?圆桌:新能源:后时代的深水淘金 | 36氪 2026产业未来大会
iOS 27 正式版体验:Siri AI 终于开窍了,老 iPhone 升级也有新东西
在金融支付系统中实施混沌工程:来自企业级 ECS 部署的经验教训
渣打给ARB十美元目标价靠什么?