字节级蒸馏与传统Token蒸馏的核心区别是什么?
传统蒸馏让学生学习教师在庞大Token词表上的概率分布,Llama 3-8B词表有128256个Token,通常只能做top-k截断;字节级蒸馏把学习单位换成字节,每个位置只有256种基础取值,预测空间更小,且不随分词器改变,完整分布更容易保留。
Meta FAIR与华盛顿大学提出字节级蒸馏方法,把教师模型的Token概率分布转换为字节级分布,让学生模型直接从字节概率学起。团队提出Marginalize-It与End-Of-Token两种方案,以Llama 3-8B为教师实验。预测显示End-Of-Token下游平均准确率上限比传统Token蒸馏高约4个百分点,训练文本量约为其六分之一、存储量约五分之一,但训练计算量更高。
传统蒸馏让学生学习教师在庞大Token词表上的概率分布,Llama 3-8B词表有128256个Token,通常只能做top-k截断;字节级蒸馏把学习单位换成字节,每个位置只有256种基础取值,预测空间更小,且不随分词器改变,完整分布更容易保留。
Marginalize-It直接聚合并重新归一化候选概率,只需一次教师前向计算,效率高,但会丢失已结束Token的部分概率信息;End-Of-Token在每个Token末尾加入特殊结束符号,让“Token结束”有明确预测位置,从而更完整地保留教师分布。
以Llama 3-8B为教师,预测平均准确率上限为Token蒸馏48.4%、Marginalize-It蒸馏50.5%、End-Of-Token蒸馏52.4%,后者高出4个百分点。End-Of-Token实际处理的文本量约为Token方案六分之一,存储量约为五分之一,但训练计算量比普通字节模型高约30.94%,推理成本也尚未做等成本比较。
CLARITY闯关失败 加密市场闻声而动 政策空白谁填补Build an AI-powered product tagging system with Amazon SageMaker serverless model customization
New insights from Google’s AI & Economy ATLAS
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点
GPT-6 Astra实现具身智能突破 中国如何打具身防卫战
美国加密新规又黄了
微软 CEO 纳德拉:AI 应用的机会正在变大,模型成本将继续下降
产品经理的体面,是一块不能失守的 “括约肌”
产品定义意义上的一级场景:四维模型
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking主题演讲:破界·量子计算迈向产业深水区——量子计算的下一公里|36氪2026产业未来大会
AI没有泡沫 只有割裂F-Droid 上的应用有多少是在 AI 帮助下编写的?
耐克、妮维雅、谷歌的警示:品类,正在误导品牌战略!
苹果Siri AI上线;豆包手机助手消费版正式发布;塔克拉玛干沙漠发现两处大型地下水水源
CLARITY折戟 多方博弈撕裂行业预期 市场怎么看?云岫资本合伙人宋旭文:量子计算:工程化与产业化并进,拐点将至 | 36氪 2026产业未来大会
月之暗面:网传创始人及员工信息系恶意造谣;OpenAI 放弃今年上市;iPhone Duo炒到9万,黄牛贷款欲囤货|AI周报
Claude在英伟达内部被限用,黄仁勋告诉特朗普:我们不会让AI发展放缓发生
社区速递 158 | 便宜耐造的副厂手柄与大学宿舍里那些相见恨晚的装备圆桌:落地·量子计算的场景涌现——如果量子算力明天就可用,谁会第一个买单 | 36氪 2026产业未来大会
云连锁到轻连锁,品牌业务逻辑的改变
飞书与豆包工作合体后首亮相:Agent 能进群,还能帮你写周报、做PPT
找不到小红书爆文选题?去淘宝差评区抄!
关于项目交付的思考:部署是最后两公里,验收才是最后一公里
旧消费品,正长出新生意
让AI真正赋能企业(初探)
美团发布“手艺人Agent”,发型师可“吩咐”AI小帮手打理线上作品芯视界创始人、董事长兼首席科学家鲍捷:十年产业实践,量子感知芯片为物理AI打开物质世界 "感知入口" | 2026年36氪产业未来大会