蚂蚁 InclusionAI 公开大模型训练档案,给欧盟 AI 法案交底
蚂蚁 InclusionAI 公开大模型训练档案,给欧盟 AI 法案交底
蚂蚁集团旗下的 InclusionAI 最近在 HuggingFace 上做了一件事:开了一个叫 AI-Transparency 的仓库,把 Ling、Ring、Ming 几个模型系列的训练内容摘要放了出来。注意,这里没有模型权重,也没有训练数据集,只有一摞文档。
简单说,这回答的是一个问题:这些模型到底拿什么数据训练的?
文档里有什么?
打开仓库,覆盖的模型版本相当全。Ling 系列从 2.0、2.5、2.6 一路排到 3.0,其中 3.0 又分了 LLM 版(flash、tiny、flash-fin)和 VL 视觉语言版(Ling-3.0-flash-VL)。Ring 系列从 2.0、2.5-1T 到 2.6-1T。Ming 家族则包括 Omni 多模态(flash-omni-preview、flash-omni-2.0),还有 UniAudio-16B-A3B 和 UniVision-16B-A3B 两个音视频统一模型。
每份摘要都标着版本号和更新日期,写明了该文档对应模型在指定层面上的训练内容。官方特意强调:这些文档不构成权威认证或背书,也不代表 InclusionAI 旗下所有模型都被覆盖了。
为什么是这种格式?
不是随便写的技术博客。这些摘要严格套用了欧盟《人工智能法案》(Regulation (EU) 2024/1689)第 53 条第 1 款 d 项所关联的“公开训练内容摘要模板”。换句话说,这是按欧盟对通用人工智能模型提供商的合规要求,用标准格式交的作业。
每份文档的覆盖范围卡得很死——提到 Ling-2.0,就只管 Ling-2.0(含 Ling1T、Ling-flash2.0、Ling-mini-2.0),不会自动扩展到同系列其他模型或带量化后缀的版本。
一个小窗口
仓库的联系页面指向蚂蚁官方开发者站点,版本历史里还特意提醒:PDF 上的日期只是文档版本日期,不代表模型首次上线时间,实际变动要看仓库的 commit 记录。
当全球监管把“训练透明度”从可选项变成硬门槛,蚂蚁这一步棋,既是在为海外合规铺路,也无意间打开了一扇小窗,让人瞥见他们的模型是怎么一步步开发出来的。
Key Points
- AI-Transparency 仓库:蚂蚁 InclusionAI 在 HuggingFace 公开 Ling、Ring、Ming 等模型的训练内容摘要,不含权重和数据集。
- 合规驱动:文档严格遵循欧盟 AI 法案第 53 条的公开训练内容摘要模板。
- 覆盖范围:Ling 2.0 至 3.0、Ring 2.0 至 2.6、Ming Omni 及两个 16B-A3B 多模态模型。
- 明确边界:每份文档只对应特定模型版本,不自动扩展,也不构成官方认证。