中文互联网基础语料 4.0 发布:120GB 可信数据上线,面向大模型训练提供中文数据支撑
据中国网络空间安全协会官方公众号消息,9 月 15 日下午,在济南召开的 2026 年国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料 4.0 正式向社会发布。该版本数据量为 120GB,并已在“中文互联网语料资源平台”上线。来源显示,用户可登录中国网络空间安全协会官网,通过相关平台入口,在完成注册、认证等流程后下载或联系获取相关数据。
对于正在快速发展的中文大模型生态而言,高质量、可信、可持续更新的中文语料供给,是模型训练、评测、对齐和行业应用落地的重要基础。此次 4.0 版本发布,延续了此前中文互联网基础语料 1.0、2.0、3.0 的建设路径,也体现出国内围绕 AI 数据底座建设的协同推进。
多方共建:中文语料从“可用”走向“可信”
根据来源信息,中文互联网基础语料 4.0 是在中央网信办指导下,由中国网络空间安全协会联合国家互联网应急中心,并会同百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等单位共同推进形成。该项目依托中国网络空间安全协会人工智能安全治理专委会建立的语料共建共享机制,汇聚了一批新的高质量可信数据。
与普通网络文本抓取不同,面向大模型训练的基础语料不仅要关注规模,也要关注来源、质量、合规性与可治理性。来源摘要提到,此次发布的数据经过了一系列严格细致的数据加工处理措施,最终形成 120GB 的中文互联网基础语料 4.0。对于模型厂商、科研机构和行业开发者来说,“可信数据”可能比单纯扩大数据量更关键,因为训练语料的质量会直接影响模型的知识覆盖、中文表达能力、事实可靠性以及安全边界。
- 发布时间:9 月 15 日下午,地点为济南相关分论坛现场。
- 发布平台:数据已在“中文互联网语料资源平台”上线。
- 数据规模:中文互联网基础语料 4.0 数据量为 120GB。
- 获取方式:用户可通过中国网络空间安全协会官网进入平台,按注册、认证等程序下载或联系获取。
- 建设主体:由中国网络空间安全协会、国家互联网应急中心及多家单位协同参与。
对大模型产业的意义:补齐中文数据底座
过去两年,大模型能力竞争不断深入,中文能力也成为国内 AI 产品体验的重要分水岭。无论是通用对话助手、企业知识库、搜索问答,还是政务、金融、教育、医疗等行业应用,模型都需要理解中文语境中的表达习惯、信息结构与领域知识。中文互联网基础语料 4.0 的发布,意味着面向社会开放的中文基础数据资源进一步扩充。
从产业视角看,这类语料资源的价值不只在于服务大模型预训练,也可能为数据清洗、模型评测、内容安全研究、中文 NLP 工具链优化等工作提供基础支撑。对于中小型 AI 团队而言,公开、规范、可获取的语料资源有助于降低数据准备门槛;对于大型模型机构而言,可信中文语料也有助于提升模型在中文场景中的稳定性和可控性。
同时,中文语料建设还关系到 AI 安全治理。来源显示,该语料是在人工智能安全治理相关机制下推进,并强调通过加工处理形成可信数据支撑。这意味着数据建设并非单纯追求规模扩张,而是与治理、合规和质量控制结合。对于生成式 AI 来说,训练数据中的噪声、偏见、低质内容和不可靠信息,都会在模型输出中被放大,因此前端语料质量控制具有基础性意义。
后续建设或将覆盖更多行业场景
中国网络空间安全协会负责人表示,中文互联网基础语料 4.0 是社会各界协同共建高质量中文语料的重要阶段性成果,进一步丰富了国内高质量中文语料供给体系。下一步,协会将继续联合国家互联网应急中心等单位,联动各行业领域深化中文互联网基础语料建设,持续为人工智能产业高质量发展筑牢数据底座。
对中文 AI 生态来说,数据底座建设将是一项长期工程。模型参数、算力和应用形态会不断变化,但高质量中文数据仍是提升模型能力的核心投入之一。随着更多机构参与共建共享,未来中文大模型训练和应用开发有望获得更稳定的数据资源支持,也将推动国内 AI 产业在中文理解、知识服务和安全治理方面形成更完善的基础设施。