跳转到主要内容

LFM2.5 DSpark草稿模型:推理速度提升3.18倍,质量不变

Liquid AI和Hugging Face刚刚为在本地运行大型语言模型的用户发布了一些有趣的东西。他们发布了LFM2.5系列的DSpark草稿模型检查点,涵盖1.2B、2.6B和8B-A1B变体。最引人注目的数字?在GPU上推理吞吐量可提升高达3.18倍,在边缘设备上提升2.87倍。关键在于:你不需要牺牲任何输出质量。

有什么大不了的?

如果你曾经在笔记本电脑或小型服务器上运行过大型模型,你就会知道痛点:速度慢。大部分延迟来自内存带宽——将庞大的模型权重从DRAM流式传输到SRAM需要时间。投机解码通过使用轻量级草稿模型猜测下一个token,然后让大模型一次性验证它们来解决这个问题。这就像有一个快速的助手起草回复,而你只需一次性批准或调整。

DSpark将这一想法付诸实践。在真实世界测试中,LFM2.5-2.6B模型在边缘代理场景中的函数调用延迟平均降低了57%。在M4 Max MacBook Pro上,它达到了每秒139个token——足够快,使得本地运行AI代理感觉比某些专有云模型更流畅。这对于那些希望在不租用昂贵云GPU的情况下获得隐私和速度的开发者来说,是一个改变游戏规则的因素。

DSpark如何施展魔法

DSpark不是单一技巧;它是三个巧妙组件的组合:

  • 并行骨干网络:受DFlash启发,它在一个前向传递中为所有草稿token生成隐藏状态,使用目标模型的上下文。不再需要顺序生成草稿。
  • 顺序头(马尔可夫头):这增加了相邻token之间的依赖关系,类似于马尔可夫链,从而提高了后续位置的接受率。这就像给草稿模型一个它刚刚写的内容的记忆。
  • 置信度调度验证器:这预测每个token存活的可能性,如果验证成本超过节省,它会提前截断低置信度的后缀。聪明的预算管理。

训练草稿模型并非事后考虑。他们使用了多样化的数据混合——SFT、聊天、代码和函数调用——经过严格的消融测试,最终确定了仅注意力的架构,包含5层和9个块,总计约3亿参数。紧凑但强大。

质量?不妥协

任何加速技术最大的担忧之一是可能会损失准确性。但由于投机解码的工作方式,输出序列与贪婪解码的结果完全相同。如果草稿token与目标模型的分布不匹配,它会被替换。因此,每个基准测试都显示没有退化。你获得了速度,而没有通常的权衡。

从第一天起即可使用

DSpark不仅仅是一篇论文——它已经与主要的推理框架集成。SGLang在加速器上支持它,并提供专用的启动配置,llama.cpp有官方构建支持,允许你通过命令行加载GGUF权重和草稿模型。这意味着你可以立即开始实验。

关键点

  • 速度提升:在GPU上推理速度提升高达3.18倍,在边缘设备上提升2.87倍。
  • 延迟降低:LFM2.5-2.6B在边缘设备上的函数调用延迟平均降低57%。
  • 质量保持:输出与贪婪解码完全匹配,无精度损失。
  • 生态就绪:开箱即用地支持SGLang和llama.cpp。
  • 本地AI优势:在M4 Max上达到139 token/秒,超越一些云模型。

Image