DSpark 如何保证加速推理时输出质量不变?
草稿模型生成候选 token,目标模型逐 token 验证;贪心解码下只有与目标模型分布一致的 token 才会被接受,因此最终输出与不使用投机解码时完全相同。
(翻译)LFM2.5-DSpark 最高可将推理速度提升 3.2 倍

A Blog post by Liquid AI on Hugging Face
Liquid AI 发布 LFM2.5 系列三款模型的 DSpark 草稿模型,通过投机解码在仅增加少量显存的情况下实现最高 3.18 倍 GPU 推理加速和 2.87 倍端侧加速,并显著降低函数调用延迟。模型支持 llama.cpp 与 SGLang,已开放 Safetensors 和 GGUF 权重。
草稿模型生成候选 token,目标模型逐 token 验证;贪心解码下只有与目标模型分布一致的 token 才会被接受,因此最终输出与不使用投机解码时完全相同。
发布时已支持 llama.cpp 和 SGLang,相关实现基于官方 DSpark 代码并在上游开源;同时提供 Safetensors 与 GGUF 权重。
在 M4 Max MacBook 上平均吞吐提升约 2.27 倍,多工具场景函数调用延迟平均降低 57%,更适合端侧代理式推理。
OpenAI 总裁最新采访:现在所有人对 AI 的预测,大概率都是错的
微信桌面端变“三折叠”,可能是在给小微腾位置
黄仁勋再谈AI危险论:中国会成为全球开源重要力量Firefox 156 释出
美股太贵 该加仓新兴市场吗?
清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人
我和我的 AI 手机吃了 3 顿饭
AI 负责创造,人来干脏活,这事儿能否停一下?圆桌:中国之光成为新共识| 36氪 2026产业未来大会
当年救了臭氧层的功臣,现在变成了永久性污染物圆桌:落地·量子计算的场景涌现——如果量子算力明天就可用,谁会第一个买单 | 36氪 2026产业未来大会
AI 写了几十页 PPT,“经营分析”报告仍被批不够深入?
Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each
美团发布“手艺人Agent”,发型师可“吩咐”AI小帮手打理线上作品华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下
YC 最值钱的这 20家公司,没有一家来自最近5年豆包手机明日开卖,AI能帮你操作App了吗?算力、机器人、仿真与资本,谁在定义物理AI下一个十年?|第十届全球ICT峰会回顾Mozilla 报告称中国开放权重模型与美国前沿模型仅相差 4.4 个月58秒出杯,能拉花的咖啡机器人,在全球70国卖出600万杯
横扫四榜,DM0.5 凭什么面面俱到?
物理 AI 的大结果何时到来?
现在参与以太坊原生质押为什么要先排队一个月?和Jeff Dean押注同一方向,27岁清华助理教授创业,两个月融资数亿量子位2026人工智能年度榜单,正式启动!
微软 CEO 纳德拉:AI 应用的机会正在变大,模型成本将继续下降
AI for everyone in every language
WorkBuddy + 美图设计室,在对话框里就能解决办公设计任务?
129亿美元卖身英伟达之后,是时候重新理解Hugging Face了