跳转到主要内容

Mistral AI的数学工具:119B参数,仅6B激活,成本仅为竞争对手的1%

欧洲AI公司Mistral AI发布了Leanstral 1.5,这是一款专为使用Lean4编程语言进行形式数学证明而设计的模型。尽管拥有1190亿参数,该模型在推理时仅激活60亿参数,以极低的计算成本提供了令人印象深刻的结果。而且它完全开源,采用Apache-2.0许可证。

Image

在核心基准测试中,Leanstral 1.5表现出色。它在miniF2F形式数学基准的验证集和测试集上均实现了100%的完成率。在数学竞赛数据集PutnamBench上,它解决了672个Lean4问题中的587个。在抽象代数的FATE系列基准测试中,它在硕士级别的FATE-H上得分87%,在博士级别的FATE-X上得分34%——均为同类最佳。

但真正引人注目的是成本。在PutnamBench上,Leanstral 1.5平均每个问题仅需4美元。相比之下,字节跳动的Seed-Prover 1.5每个问题成本超过300美元,而Aleph Prover为54-68美元。这大约是最强竞争对手成本的1%,消除了大规模形式证明应用的主要经济障碍。

在实际工程测试中,Leanstral 1.5证明了其价值。它在57个代码仓库中识别出47个违规属性,其中11个指向真实代码缺陷——其中5个是GitHub上从未报告过的全新问题。从纯数学竞赛到实际软件验证,该模型表明参数大小并非一切;高效激活才是使AI推理实用的关键。

关键点

  • 模型:Leanstral 1.5,专为Lean4形式证明设计。
  • 架构:总计119B参数,推理时仅激活6B。
  • 性能:miniF2F上100%;PutnamBench上587/672;FATE基准测试中最高分。
  • 成本:PutnamBench上每个问题约4美元,约为竞争对手成本的1%。
  • 实际应用:在代码仓库中发现47个违规,包括5个先前未知的缺陷。
  • 许可证:Apache-2.0开源。