跳转到主要内容

蚂蚁集团InclusionAI公开AI训练数据

蚂蚁集团InclusionAI公开AI训练数据

蚂蚁集团的AI部门InclusionAI在HuggingFace上悄然迈出了大胆的一步。他们推出了一个名为AI-Transparency的仓库,发布其主要模型系列(Ling、Ring和Ming)训练数据的详细摘要。但关键在于——这不是为了共享权重或数据集。而是为了回答一个简单的问题:这些模型究竟从什么数据中学习?

合规角度

这不仅仅是一篇随意的博客文章。这些摘要遵循一个严格的模板,与《欧盟人工智能法案》第53(1)(d)条相关——该法规强制通用AI模型的提供者披露其训练内容。换句话说,蚂蚁集团正在勾选一个监管框。每份文档仅涵盖其提到的特定模型版本。例如,如果提到Ling-2.0,它只涵盖Ling-2.0(包括Ling1T、Ling-flash2.0和Ling-mini-2.0)。没有笼统的声明,也没有对其他版本的假设。

涵盖范围

列表很广泛。在Ling方面,从2.0到3.0都有,其中3.0分为LLM(flash、tiny、flash-fin)和VL(视觉语言)版本。Ring从2.0到2.6-1T。而Ming系列包括Omni多模态模型(如flash-omni-preview和flash-omni-2.0)以及两个统一音视频模型:UniAudio-16B-A3B和UniVision-16B-A3B。每个摘要都带有自己的版本号和更新日期,在高层次上描述训练内容——没有原始数据,也没有授予第三方权利。

细则

蚂蚁集团谨慎地指出,这些文档不是认证或认可。它们并不涵盖所有InclusionAI模型。联系页面指向蚂蚁集团的Ling官方开发者网站,版本历史提醒读者PDF日期只是文档版本——不是发布日期。要了解实际更改,需要查看仓库的提交记录。

为何重要

随着全球法规将“训练透明度”从锦上添花变成硬性要求,蚂蚁集团系统性地发布训练摘要服务于两个目的。首先,它为海外合规铺平道路。其次,它提供了一个难得的机会,一窥其模型是如何构建的。这是一个小窗口,但很有启发性。

关键要点

  • 蚂蚁集团的InclusionAI在HuggingFace上发布了Ling、Ring和Ming模型的训练摘要。
  • 此举符合《欧盟人工智能法案》的透明度要求(第53(1)(d)条)。
  • 文档仅涵盖特定模型版本——不共享权重或原始数据。
  • 仓库包括从Ling-2.0到Ling-3.0、Ring-2.0到Ring-2.6以及Ming Omni和两个16B-A3B多模态模型。
  • 蚂蚁集团强调这些摘要不是认证,也不涵盖所有模型。