国家数据局:全国高质量数据集已达12万个,数据供给体系加速支撑AI发展
据国家数据局消息,截至今年6月底,我国已建成高质量数据集12万个,覆盖科学研究、工业制造、医疗卫生、教育教学等多个行业领域,总体量超过1565PB,较一季度末增长超过60%。来源显示,这一规模约相当于中国国家图书馆数字资源总量的547倍,为人工智能模型训练、行业应用落地和数据要素流通提供了更充足的基础资源。
对于AI产业而言,高质量数据并不只是“数据更多”,更关键的是数据能否被有效组织、治理、标注并用于模型迭代。随着大模型从通用能力竞争走向行业场景落地,数据集的专业性、可用性和合规性,正在成为影响模型效果的重要变量。
高质量数据集扩容,覆盖科研、制造、医疗与教育等领域
本次披露的核心信息显示,全国已建成的高质量数据集数量达到12万个,总体量超过1565PB。其覆盖范围包括科学研究、工业制造、医疗卫生、教育教学等行业,这些领域也是当前AI应用需求较强、数据价值密度较高的方向。
在科研场景中,高质量数据集可用于辅助文献分析、实验数据处理、材料与生物医药研究等任务;在工业制造领域,设备运行、质检图像、工艺参数等数据可支撑预测性维护、智能质检和生产优化;在医疗卫生领域,经过规范治理的数据有助于推动辅助诊断、健康管理和医学研究;教育教学数据则可能用于智能教学、学习评估和内容生成等应用。
值得注意的是,来源提到数据集体量较一季度末增长超过60%,这说明优质数据供给正在快速扩容。对国内AI企业、科研机构和行业应用方而言,数据资源的系统化建设正在从分散积累转向规模化供给,有望缓解部分模型训练和行业调优中“有场景、缺数据”的问题。
数据标注产业同步发展,七个先行城市标注规模超119PB
高质量数据集建设离不开数据标注。来源显示,截至今年6月底,四川成都、辽宁沈阳、安徽合肥、湖南长沙、海南海口、河北保定、山西大同七个数据标注先行先试城市的标注规模超过119PB,数据标注从业人员达到14万人。
数据标注是AI产业链中较基础但极其关键的环节。无论是图像识别、语音识别、文本理解,还是多模态大模型训练,都需要通过标注、清洗、分类、审核等流程提升数据可用性。随着大模型应用进入政务、工业、医疗、教育等专业领域,标注工作也不再只是简单打标签,而是越来越依赖行业知识、质量控制和数据安全管理。
- 规模扩大:七个先行城市标注规模已超过119PB,显示数据处理能力正在集中形成。
- 就业带动:数据标注从业人员达到14万人,相关岗位成为AI产业链中的重要组成部分。
- 质量要求提升:面向行业模型的数据标注,需要更专业的规则设计、复核机制和场景理解。
- 区域布局成形:成都、沈阳、合肥、长沙、海口、保定、大同等城市正在承担先行探索任务。
影响解读:AI竞争从“模型参数”转向“数据—应用—迭代”闭环
国家数据局提出,下一步将深化构建服务人工智能的高质量数据供给体系,以模型应用牵引数据供给、以数据驱动模型迭代,并推动实现数据集有偿使用的价值闭环。这一表述释放出一个清晰信号:数据不再只是模型训练前的原材料,而是贯穿应用反馈、模型优化和商业化流通的核心资产。
过去一段时间,大模型竞争更多集中在参数规模、算力投入和通用能力评测上。但在真实产业场景中,模型能否解决具体问题,往往取决于是否拥有足够高质量、可持续更新、与业务流程匹配的数据。行业数据集的建设速度和供给机制,可能直接影响AI应用落地效率。
“有偿使用的价值闭环”同样值得关注。对于数据生产方而言,若高质量数据集能够通过规范机制获得收益,将有助于激励更多机构参与数据治理和开放;对于模型企业和应用开发者而言,标准化、可交易、可追溯的数据供给,也可能降低数据获取的不确定性。不过,这一过程仍需要在数据安全、隐私保护、权属确认和收益分配等方面建立更完善的规则。
总体来看,全国高质量数据集达到12万个,标志着我国面向AI发展的数据基础设施正在加速完善。随着数据供给、标注能力和模型应用之间的联动增强,未来AI产业的关键竞争力将不只是训练出更强模型,也包括能否持续获得高质量行业数据并形成可循环的应用反馈体系。