跳转到主要内容

LFM2.5 DSpark草稿模型将推理速度提升3.18倍

Liquid AI和Hugging Face刚刚发布了LFM2.5系列的DSpark草稿模型,他们对速度做出了一些大胆的宣称。新的检查点涵盖LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B,并承诺在不牺牲输出质量的情况下提高推理吞吐量。

有什么大不了的?

在真实世界的测试中,DSpark提供了一些令人瞩目的数字。在GPU上,整体吞吐量提升了高达3.18倍。边缘设备也不甘落后,改进幅度高达2.87倍。但这里真正有趣的是:在边缘代理场景中,LFM2.5-2.6B的函数调用延迟平均下降了57%。这对于在本地运行AI代理来说是一个改变游戏规则的因素。

以M4Max MacBook Pro为例。使用DSpark,它可以每秒生成高达139个令牌。这足够快,使本地部署感觉流畅,甚至在用户体验上可以与一些专有云模型相媲美。所以,如果你一直在犹豫是否在自己的硬件上运行AI代理,这可能是你需要的推动力。

DSpark是如何工作的?

要理解DSpark,你首先需要知道为什么大型语言模型很慢。瓶颈通常是内存带宽——将模型权重从DRAM流式传输到SRAM需要时间。投机解码通过使用轻量级草稿模型快速生成候选令牌,然后目标模型一次性验证所有令牌来解决这个问题。这分散了加载权重的成本并加快了速度。

DSpark基于这个想法构建了三个核心组件:

  • 并行骨干网络:受DFlash启发,它使用目标模型的上下文特征在一次前向传递中生成所有草稿令牌的隐藏状态。
  • 顺序头(马尔可夫头):它模拟相邻令牌之间的马尔可夫链以增加依赖性,从而提高后续令牌的接受率。
  • 置信度调度验证器:它预测每个令牌的生存概率,并在验证成本超过节省时自动切断低置信度的后缀。

训练草稿模型并非易事。团队使用了多样化的数据混合,包括SFT、聊天、代码和函数调用。经过严格的消融实验,他们确定了一个仅注意力的架构,具有5层和9个块,总计约3亿个参数。

质量和兼容性

投机解码最酷的事情之一是它不会影响输出质量。在贪婪解码下,草稿令牌只有在与目标模型的分布完全匹配时才会被接受。如果被拒绝,目标模型自己的令牌将取而代之。因此,输出序列与没有DSpark时保持一致。没有准确性损失,没有基准下降。

如果你担心集成问题,DSpark从一开始就运行良好。第一天,它就兼容两个主要的推理框架:

  • SGLang:你可以在加速器上运行它,具有专门的集成和启动配置。
  • llama.cpp:官方构建支持已就绪,你可以通过命令行加载GGUF权重和草稿模型文件。

所以,无论你是希望加速本地AI实验的开发者,还是只是对最新的AI推理技术感到好奇,DSpark都值得一看。这是朝着让高性能AI更易于访问、就在你自己的机器上迈出的坚实一步。

关键点

  • LFM2.5系列的DSpark草稿模型现已从Liquid AI和Hugging Face获得。
  • 推理速度提升:GPU上高达3.18倍,边缘设备上2.87倍。
  • 边缘函数调用延迟降低57%,M4Max MacBook Pro上每秒139个令牌。
  • 使用投机解码,具有并行骨干、马尔可夫头和置信度调度。
  • 无质量损失;第一天兼容SGLang和llama.cpp。