跳转到主要内容

NVIDIA的AI技巧:跨模型复用“作业”,推理速度提升25倍

你有没有注意到ChatGPT或Claude在说出第一个词之前会停顿一下,然后其余部分就像瀑布一样流出?这不是故障——这是设计使然。在生成任何内容之前,模型必须处理你的整个输入,将中间结果存储在所谓的KV缓存中。一旦完成,每个后续单词都会更快地输出,因为它重用了该缓存。

但问题是:该缓存一直是单模型专用的。切换到不同的模型,甚至升级到新版本,旧缓存就会变得无用。新模型必须从头开始重新处理所有内容,这浪费了大量的时间和计算能力——尤其是对于长文档或长对话。

现在,NVIDIA的研究团队解决了这个问题。他们找到了一种在不同模型之间迁移KV缓存的方法。目标模型可以完全跳过预填充阶段,而转换过程本身比重新处理上下文快2.7到25倍。这就像拥有一个适用于任何考试的作弊表,无论科目如何。

为什么这很重要?首先,使用LLM API的成本很大一部分来自上下文处理。在长对话或处理大量文档时,这种开销会累积。如果缓存可以在模型之间共享,用户就不必在每次切换时支付冗余计算费用。模型升级变得无缝——你保留对话历史而无需额外成本。

这可能会重塑AI推理基础设施的构建方式。与其每个模型都生活在自己的孤岛中,我们可能会看到一个更加互联的生态系统,模型可以像接力赛一样传递上下文。对于依赖AI的开发者和企业来说,这意味着巨大的影响,使模型切换更加经济高效。

当然,仍然存在问题。转换在底层是如何工作的?是否有任何限制?但潜力是明确的:这是朝着更灵活、更具成本效益的AI格局迈出的一步。

关键点

  • KV缓存迁移:NVIDIA的方法允许KV缓存在模型之间转移,跳过预填充阶段。
  • 速度提升:转换比重新处理上下文快2.7到25倍。
  • 成本节省:减少切换模型时的冗余计算,降低API成本。
  • 无缝升级:模型更新不会要求丢弃现有的对话上下文。
  • 行业影响:可能改变AI基础设施设计,使模型切换更加经济。