DeepSeek V4 如何把图片转换成语言模型能处理的 Token?
图片先经32层ViT切成14×14 patch并编码成1024维向量,再由3×3 Aligner把相邻9个特征合并后经两层映射进入4096维隐藏空间,使视觉网格规模约降至九分之一。

作者丨 郑 佳 美 编辑丨 岑 峰 &n
DeepSeek V4多模态模型开放权重,文章拆解其视觉链路:图片经32层ViT和二维RoPE编码后,由3×3 Aligner压缩,视觉Token进入V4主干并继续参与Attention、MoE与Agent推理;同时分析视觉Token特殊处理、bias_vl专家路由,以及视觉Agent重复计算和长上下文开销问题。
图片先经32层ViT切成14×14 patch并编码成1024维向量,再由3×3 Aligner把相邻9个特征合并后经两层映射进入4096维隐藏空间,使视觉网格规模约降至九分之一。
视觉位置 ID 超出词表,Attention 会扩展图片内部可见范围,避免整张截图被128 Token滑窗切断;MoE 路由也为视觉 Token 单独设置 bias_vl,Hash-MoE 则跳过基于 Token ID 的专家映射。
每轮环境观察都要对整张截图重新缩放、patch化、过 ViT 和 Aligner 并 prefill,相邻截图大部分未变化但会被反复计算;作者建议可通过 ViT 缓存、视觉差分或混合环境表示来降低开销。
“极端”空头压境 美联储周三不加息就是最大意外
美国加密新规又黄了地平线第1500万颗征程芯片搭载大众 ID. AURA T6,HSD V2.1 即将推出企业案例分享:玉盘量智-离子阱量子计算芯片化集成工程实践 | 36氪 2026产业未来大会
就业率砍半,年轻人靠什么翻盘?AI时代,这三点越早做越好
AI 负责创造,人来干脏活,这事儿能否停一下?
读完斯坦福116页AI实施手册,我最大的感受是:别再盯着模型了
现在参与以太坊原生质押为什么要先排队一个月?全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型Mistral 与 Mozilla 合作推出 Firefox Smart Window
社区速递 158 | 便宜耐造的副厂手柄与大学宿舍里那些相见恨晚的装备圆桌:落地·量子计算的场景涌现——如果量子算力明天就可用,谁会第一个买单 | 36氪 2026产业未来大会
抖音上线 “免费短剧” App,短剧赛道再添一员猛将
OpenAI万亿IPO推迟背后 四本账与三条投资路径前OpenAI后训练VP回应陶哲轩:说AI毁了数学,可能还是太小瞧AI了
How NVIDIA Groq 3 LPX Deterministic Execution Drives Power-Efficient High-Interactivity Inference on NVIDIA Vera Rubin
一年28倍妖王:谁在爆炒?AWS 称无法恢复中东部分可用区资源和数据的访问
How NVIDIA NVLink 6 Delivers Multi-Layer Resiliency for AI FactoriesMeta新研究:字节模型蒸馏后,天花板破了
物理 AI 的大结果何时到来?
视频号评论区小蓝词使用指南
实测豆包新模型2.1-pro,这次审美和长时间Agent任务都追上第一档了
奇安信斩获国家信息安全漏洞库CNNVD两项重磅荣誉
AI for everyone in every language
从担心AI失控 到AI造福人类:比尔盖茨怎么想Build an AI-powered product tagging system with Amazon SageMaker serverless model customization9月21日,深圳前海!聊聊工业AI与生态共创的下一步36氪项目新势榜:不看包装,只看项目真实进展
担心代码被拿去训练!英伟达:限制员工使用 Claude;一汽将成广汽第二大股东!南北丰田拟合并;苹果回应「iPhone 18 Pro破发」