跳转到主要内容

Neon和Castform的4B模型在搜索中击败GPT-5.6,成本仅1%

在AI领域,更大往往意味着更好。但Neon和Castform刚刚颠覆了这一观念。他们训练了一个仅有40亿参数的开源模型,不仅在文档搜索任务上匹敌甚至超越了强大的GPT-5.6,而且成本极低。我们说的是每次推理成本的百分之一。这简直是颠覆性的。

那么,秘诀是什么?关键在于重新思考搜索的工作方式。传统上,文档检索依赖于基于嵌入的搜索。你将文档转换为数值向量,然后找到相似的向量。这就像在图书馆里通过匹配书脊上的关键词来寻找一本书。但随着AI代理的兴起,搜索范式正在转变。代理不是一次性查询,而是将复杂问题分解为更小的问题,决定搜索什么,审查结果,然后再次搜索。这是一个更周到、迭代的过程,可以处理更棘手的问题。

但问题在于:这种基于代理的搜索通常需要高性能模型来处理每一步,这意味着高延迟和高成本。根据Neon的典型请求规格,使用GPT-5.6Sol进行一次搜索需要超过10秒,成本约为0.03美元。这听起来可能不多,但当进行数百万次搜索时,成本会迅速累积。

Neon和Castform各自带来了自己的优势。Neon提供了文档存储和搜索能力,而Castform专注于训练模型来决定“搜索什么”。他们使用了强化学习,模型尝试完成任务,根据结果获得分数,然后利用反馈进行改进。评估不仅关注最终答案是否正确,还检查模型是否找到了正确的文档并引用了适当的章节。这是一种更全面的衡量成功的方式。

结果令人印象深刻。Castform的模型在Neon的验证中平均得分为1.447,超过了GPT-5.6Sol的1.369,甚至超过了对照组GPT-5.4的1.377。这是该验证的新纪录。

这对未来意味着什么?它表明,你并不总是需要一个庞大、昂贵的模型才能获得顶级性能。通过巧妙的训练和明确的劳动分工,较小的模型可以超越其体量。对于企业和开发者来说,这可能意味着更快、更便宜、更高效的搜索能力。而对于我们其他人来说,这提醒我们,有时弱者也能获胜。

Image

关键要点

  • Neon和Castform训练了一个4B参数模型,在文档搜索准确性上超越了GPT-5.6。
  • 每次推理的成本仅为GPT-5.6的1%,使其成为一种经济高效的替代方案。
  • 该模型使用强化学习,并从基于嵌入的搜索转向基于代理的搜索。
  • 评估不仅考虑了最终答案,还考虑了文档检索和引用准确性。
  • 这一突破挑战了“更大模型总是更好”的假设。