跳转到主要内容

120GB可信中文数据正式上线,用于AI训练

中国刚刚发布了120GB高质量数据用于AI训练

9月15日下午,在济南一个拥挤的会议厅里,中国AI领域发生了一件大事——这不是一场炫目的产品发布会。中文互联网基础语料4.0在国家网络安全宣传周的AI安全治理分论坛上正式发布。数据?足足120GB经过精心筛选的高质量中文文本。它现已上线中文互联网语料资源平台,供开发者和研究人员使用。

为什么这很重要

训练一个大语言模型很像做一顿大餐。你可以拥有最好的厨房和最花哨的食谱,但如果你的食材不新鲜或质量低劣,最终的菜肴不会让任何人印象深刻。这正是该语料库旨在解决的问题。在中国网信办的指导下,中国网络安全协会国家互联网应急中心以及一系列科技巨头——百度、中科闻歌、科普云、拓尔思、科大讯飞和知乎——联手合作。他们汇集资源和专业知识,为中国蓬勃发展的AI行业构建可信的数据供给。

这不是他们第一次做这件事。1.0、2.0和3.0版本奠定了基础,而网信办AI安全治理委员会建立的共建共享机制使得收集新鲜、高质量的数据成为可能。经过严格的处理和筛选,4.0版本诞生了——精炼且可供公众使用。

官员们怎么说

网络安全协会的一位代表称此次发布是社会各界协同构建顶级中文语料的“重大里程碑”。他们指出,这进一步丰富了国内高质量中文数据的供给体系。而且他们不会止步于此。协会计划继续与国家互联网应急中心和其他合作伙伴合作,深化语料库建设,为整个AI生态系统奠定坚实的数据基础。

如何获取数据

如果你是渴望获得该语料的开发者或研究人员,以下是操作步骤:前往中国网络安全协会官网,找到中文互联网语料资源平台,按照注册和认证程序操作。验证通过后,你可以下载数据或联系获取特定语料集。就这么简单。

要点

  • 120GB高质量、可信的中文数据发布用于AI训练。
  • 中国网络安全协会百度、科大讯飞和知乎等合作伙伴共同构建。
  • 9月15日在济南国家网络安全宣传周上发布。
  • 注册后可通过中文互联网语料资源平台获取。
  • 旨在促进大模型训练并支持中国AI产业发展。

在数据成为新石油的世界里,这次发布不仅仅是一个数字——它是推动中国AI创新下一波浪潮的战略举措。对于开发者来说,这是一个等待挖掘的宝库。