跳转到主要内容

蚂蚁集团公开AI训练数据以符合欧盟规定

蚂蚁集团inclusionAI揭开AI训练数据的面纱

蚂蚁集团的inclusionAI在HuggingFace上推出了一个名为AI-Transparency的新仓库。但别指望在这里下载模型权重或数据集。相反,他们发布的是Ling、Ring和Ming系列模型训练内容的摘要。这是一个深思熟虑的举动,旨在回答一个常被蒙在鼓里的问题:模型究竟从什么数据中学习?

该仓库覆盖了广泛的模型。在Ling方面,从Ling-2.0到Ling-3.0,包括LLM版本(flash、tiny、flash-fin)和VL(视觉语言)变体Ling-3.0-flash-VL。Ring系列涵盖2.0、2.5-1T和2.6-1T。Ming家族包括Omni多模态模型(如flash-omni-preview和flash-omni-2.0),以及两个统一的音频和视觉模型:UniAudio-16B-A3B和UniVision-16B-A3B。

每份摘要严格限定于其所涉及的模型和版本。如果文档提到Ling-2.0,它只涵盖Ling-2.0——包括Ling1T、Ling-flash2.0和Ling-mini-2.0——不会延伸到其他模型或量化版本。所有文档都标有版本和日期,并高度概括地描述训练内容,而不交出实际训练数据或授予第三方任何权利。

为何重要:与欧盟《人工智能法案》的关联

这并非随意的开放行为。该框架遵循与欧盟《人工智能法案》(Regulation 2024/1689)第53(1)(d)条相关的公开训练内容摘要模板。简而言之:这是欧盟通用人工智能模型提供商应使用的标准化格式。因此,蚂蚁集团本质上是在勾选一个合规框——但方式也让外界得以一窥其内部运作。

值得注意的是,官方页面强调这些文档并非认可或认证。它们并不意味着inclusionAI的每个模型都被覆盖。PDF中的日期只是文档版本日期,并非模型首次上线的时间。要了解真正的变更,需要查看仓库中的提交历史。

窥探模型开发的一扇小窗

随着全球监管将“训练透明度”从“锦上添花”变为硬性要求,蚂蚁集团系统性地发布这些摘要服务于两个目的。首先,为海外合规铺平道路。其次,悄然打开一扇了解其模型开发方式的窗口——而这通常是闭门不宣的。

联系页面指向蚂蚁集团Ling的官方开发者网站。版本历史提醒读者,PDF日期只是文档版本,并非模型发布日期。要了解实际变更,请查看仓库的提交记录。

关键要点:

  • HuggingFace上的AI-Transparency仓库分享训练数据摘要,而非权重或数据集。
  • 覆盖Ling、Ring和Ming模型系列,具有严格的版本范围。
  • 遵循欧盟《人工智能法案》第53(1)(d)条的公开训练内容摘要模板。
  • 文档标有版本和日期,但不授予训练数据的权利。
  • 蚂蚁集团强调这并非认证或认可——只是合规和窥探开发过程。