跳转到主要内容

OpenBMB的MathForm 8B:自动数学证明的新希望

在构建人工通用智能的探索中,最棘手的问题之一是让机器真正理解数学。这不仅仅是计算数字——而是阅读定理,理解其含义,然后用像Lean4这样的形式语言进行验证。这是一个艰巨的任务,但OpenBMB团队通过他们新的开源项目MathForm迈出了一大步。

多年来,障碍在于形式化数学并不是简单的翻译工作。你不能只是把自然语言的证明转换成代码。一个严谨的模型必须将每一个概念映射到Mathlib中正确的类型和定义,Mathlib是一个庞大的形式化数学库。关键在于:即使一个语句通过了编译器,它可能在语义上仍然不正确——它可能并没有真正描述原始问题。这是一种一直困扰该领域的隐性失败。

那么,OpenBMB做了什么不同的事情?他们构建了一个专注于检索和验证的框架。系统首先使用一个“检索规划器”来查找必要的Mathlib定义和现有的形式化模型。然后,生成器接管,但它不仅仅是生成代码就完事了。它使用Lean编译器的反馈和语义一致性检查,最多修改其输出三次。这种反复的过程确保了代码不仅在语法上正确,而且在数学上忠实。

在数据方面,他们引入了FormalVerse,一个包含超过367,000个经过验证的Lean4示例的数据集,涵盖了广泛的数学领域。当他们在这个数据集上训练模型时,结果令人瞩目。在相同的训练预算和起始条件下,一致性检查率达到60.32%——比FineLeanCorpus的46.53%和NuminaMath-LEAN的41.49%有大幅提升。这清楚地证明了他们数据质量的优势。

最引人注目的是MathForm-8B,一个相当紧凑的模型。在六个基准测试中,它以88.06%的语法检查通过率和72.37%的一致性检查通过率表现出色。但真正令人惊讶的是:它超越了更大的模型,如ReForm-32B和Goedel-Formalizer-V2-32B,尽管参数只有它们的四分之一。在最难的子集FATE-H和FATE-X上,它分别达到了63%和37%的一致性检查成功率——比最强的专门基准高出10和12个百分点。这不仅仅是边际改进;这是一个声明。

这对未来意味着什么?首先,它表明你不需要一个庞大的模型来在形式数学中承担繁重的工作。效率和智能数据可以胜过纯粹的规模。随着MathForm的开源,研究人员和开发者可以开始在这个基础上构建,可能加速自动定理证明的进展,并使我们更接近能够真正推理的AI。

如果你好奇,你可以在GitHub上深入代码和数据集。该项目是活跃的,社区已经热闹起来。无论你是数学家、开发者,还是只是对AI感兴趣的人,这都是一个值得关注的发展。

关键要点

  • MathForm框架:使用检索增强生成和验证引导的修订,确保语法和语义的正确性。
  • FormalVerse数据集:超过367,000个经过验证的Lean4示例,实现60.32%的一致性检查率——远超现有数据集。
  • MathForm-8B模型:在基准测试中优于更大的模型,如ReForm-32B和Goedel-Formalizer-V2-32B,语法通过率88.06%,一致性通过率72.37%。
  • 开源:该项目可在GitHub上获取,邀请合作和进一步创新。