跳转到主要内容

Mistral AI 的 Leanstral 1.5:让数学证明更便宜、更易获取

Mistral AI 的 Leanstral 1.5:让数学证明更便宜、更易获取

Mistral AI 刚刚发布了一个新的开源模型,可能会改变数学家和开发者处理形式化证明的方式。这款名为 Leanstral 1.5 的模型专为 Lean4 设计,Lean4 是一种用于编写和验证数学证明的语言。其数据令人印象深刻。

内部构造

Leanstral 1.5 是一个混合专家模型,总参数达 1190 亿,但每个 token 仅激活 60 亿参数。这意味着它在计算和成本方面都很高效。该模型采用 Apache-2.0 许可证发布,任何人都可以使用、修改或在此基础上构建。

性能表现

在测试形式化数学的 miniF2F 基准测试中,Leanstral 1.5 在验证集和测试集上均获得满分 100%。但这还不是全部。

面对以难度著称的 PutnamBench——来自威廉·洛厄尔·普特南数学竞赛的问题集——该模型解决了 672 个 Lean4 问题中的 587 个,成功率达 87%。要知道,这些问题连最聪明的数学学生都感到棘手。

在涵盖抽象代数的 FATE 基准测试系列中,Leanstral 1.5 在专家级 FATE-H 测试中达到 87%,在博士级 FATE-X 测试中达到 34%。这些成绩创下了此类模型的新纪录。

Image

成本优势:游戏规则改变者

最令人关注的是成本。Mistral AI 声称,使用 Leanstral 1.5 解决一个 PutnamBench 问题的平均成本仅为 4 美元。相比之下,Seed-Prover1.5 每个问题成本超过 300 美元,Aleph Prover 则在 54 到 68 美元之间。成本降低了 75 到 150 倍。

这不仅仅是省钱的问题,更是可及性的问题。高精度的证明辅助工具此前主要局限于资金充足的实验室。有了 Leanstral 1.5,小型研究团队甚至个人数学家也能负担得起形式化验证工具。

不止于数学:代码漏洞发现

Leanstral 1.5 不仅用于证明定理,还展现出强大的 漏洞发现能力。在 57 个代码仓库的测试中,该模型识别出 47 个违规,其中 11 个被确认为真实缺陷。值得注意的是,其中有 5 个漏洞此前从未在 GitHub 上报告过。这对软件安全意义重大。

未来意义

通过开源 Leanstral 1.5,Mistral AI 降低了形式化数学研究的门槛。该模型的高效和低成本可能加速形式化证明在数学和计算机科学领域的应用。研究人员现在可以专注于创造性工作——开拓新领域——而将繁琐的验证交给 AI。

关键点

  • 模型:Leanstral 1.5,一个 119B 参数的混合专家模型(6B 活跃参数),专为 Lean4 设计。
  • 性能:miniF2F 上 100%,PutnamBench 上 87%,FATE 基准测试创纪录。
  • 成本:每个 PutnamBench 问题 4 美元,而竞争对手超过 300 美元。
  • 漏洞发现:在代码仓库中识别出 47 个违规,包括 5 个此前未知的漏洞。
  • 许可证:Apache-2.0,完全开源。