蚂蚁集团InclusionAI根据欧盟AI法案公开训练数据说明
蚂蚁集团InclusionAI根据欧盟AI法案公开训练数据说明
蚂蚁集团的InclusionAI在HuggingFace上悄然迈出了大胆的一步。该公司推出了一个名为AI-Transparency的仓库,公开分享其主要模型系列——Ling、Ring和Ming的训练内容摘要。这并非发布模型权重或数据集,而是回答了一个简单却棘手的问题:这些模型究竟从哪些数据中学习?
该仓库仅包含文档——没有权重,没有训练数据集。但它清晰地描绘了从Ling-2.0到Ling-3.0、Ring-2.0到Ring-2.6,以及Ming-Omni和两个16B-A3B多模态模型的来源。每份摘要严格限于其命名的模型和版本。例如,提到Ling-2.0,就只涵盖Ling-2.0(包括Ling1T、Ling-flash2.0和Ling-mini-2.0),不会涉及该系列中的其他模型或带有量化后缀的模型。
监管示意,而非博客文章
关键在于:这种摘要格式并非自创。它遵循与欧盟《人工智能法案》(法规2024/1689)第53(1)(d)条相关的“公开训练内容摘要模板”。简而言之,这是欧洲通用人工智能模型提供商必须进行的标准化披露。蚂蚁不仅仅是在写技术博客——它是在勾选合规选项。
覆盖范围广泛。沿着Ling系列,有2.0、2.5、2.6和3.0,其中3.0分为LLM(flash、tiny、flash-fin)和VL(视觉语言)版本,如Ling-3.0-flash-VL。Ring从2.0到2.5-1T和2.6-1T。Ming系列包括Omni多模态模型(flash-omni-preview和flash-omni-2.0)以及UniAudio-16B-A3B和UniVision-16B-A3B——两个统一的音频和视觉模型。每份摘要都带有自己的版本号和更新日期,描述了指定级别的训练内容。不分发底层数据,也不授予第三方权利。
官方提醒:这些文件并非权威认证或认可。它们也不意味着覆盖了InclusionAI的所有模型。联系页面指向蚂蚁的Ling官方开发者网站。版本历史提醒读者,PDF中的日期是文档版本日期,而非首次在线发布时间。如需了解实际变更,请查看仓库的提交记录。
为何重要
随着全球监管将“训练透明度”从锦上添花变为硬性门槛,蚂蚁系统性地发布其整个模型系列的训练摘要,实现了两件事。首先,它为海外合规铺平了道路。其次,它意外地打开了一扇小窗,让人得以一窥其模型的开发方式。对于关注AI治理的人来说,这是安静但重要的一步。
要点:
- 蚂蚁集团的InclusionAI在HuggingFace上推出了AI-Transparency,披露了Ling、Ring和Ming模型的训练摘要。
- 该格式遵循欧盟AI法案第53(1)(d)条的公开训练内容摘要模板。
- 覆盖范围包括Ling-2.0至3.0、Ring-2.0至2.6,以及Ming-Omni和两个16B-A3B多模态模型。
- 不共享权重或数据集;每份文档都针对特定版本,且不授予第三方权利。
- 官方指出,这些文件并非认证,也不覆盖所有InclusionAI模型。