LFM2.5 DSpark草稿模型:推理速度提升3.18倍,质量不变
Liquid AI和Hugging Face刚刚为开发者带来了一些令人兴奋的东西:LFM2.5系列的DSpark草稿模型检查点。这不仅仅是又一次增量更新——这是一个巧妙的技巧,使AI推理速度大幅提升,同时不牺牲任何质量。可以把它想象成给你的大型语言模型加了一个涡轮增压器。
重大胜利:真正重要的速度
那么,实际影响是什么?在GPU上,吞吐量最高可提升3.18倍。在边缘设备上,提升幅度仍然令人印象深刻,达到2.87倍。但这里才是真正有趣的地方:在边缘代理场景中,LFM2.5-2.6B的函数调用延迟平均下降了57%。这不仅仅是一个数字——这意味着在M4 Max MacBook Pro这样的设备上本地运行AI代理可以达到每秒139个令牌。这个速度足以让你忘记自己不是在使用云服务。
DSpark是如何实现这一点的
你可能会想:它是如何做到如此之快的?秘密在于一种称为投机解码的技术。传统模型受限于内存带宽——它们大部分时间都在将权重从DRAM转移到SRAM。投机解码改变了这一局面:一个轻量级的草稿模型快速生成候选令牌,然后大模型一次性验证它们。这就像有一个初级助理起草回复,然后高级编辑一次性批准。
DSpark将这个想法发扬光大,结合了三个巧妙的组件:
- 并行骨干网络:受DFlash启发,它基于目标模型的上下文,在单次传递中生成所有草稿令牌的隐藏状态。
- 顺序头(马尔可夫头):模拟相邻令牌之间的马尔可夫链,提高后续位置的接受率。
- 置信度调度验证器:预测每个令牌的生存概率,并在验证成本超过节省时修剪低置信度的后缀。
草稿模型本身在多样化的数据混合上进行了训练——SFT、聊天、代码和函数调用。经过严格的消融测试,他们最终采用了仅注意力的架构,包含5层和9个块,总参数约3亿。这足够紧凑,可以高效运行,同时仍然有效。
质量?不打折扣
任何优化最大的担忧之一是它是否会降低输出质量。这里令人放心的是:由于投机解码的工作方式,草稿令牌只有在与目标模型的分布完全匹配时才会被接受。如果不匹配,目标模型自己的令牌会接管。因此,输出序列与贪婪解码得到的结果完全相同。在基准测试中,准确率零损失。这是双赢。
今天就可以使用
DSpark不仅仅是一篇研究论文——它已经准备好投入生产。第一天就支持两个主要的推理框架:
- SGLang:您可以在加速器上运行它,并带有专门的集成和启动配置。
- llama.cpp:官方构建支持允许您通过命令行加载GGUF权重和草稿模型文件。
因此,无论您是在构建边缘AI应用,还是只想在本地机器上获得更快的推理,DSpark都值得一看。这是朝着让AI更易访问、更响应迅速迈出的实际一步,就在您需要的地方。
关键点
- 速度提升:GPU上推理速度提升高达3.18倍,边缘设备上提升2.87倍。
- 延迟降低:边缘设备上LFM2.5-2.6B的函数调用延迟降低57%。
- 质量保持:由于投机解码,基准测试中无准确率损失。
- 生态就绪:第一天就兼容SGLang和llama.cpp。
- 架构:3亿参数的草稿模型,具有并行骨干、马尔可夫头和置信度验证器。