人工智能

国家数据局:全国高质量数据集已达12万个,总量超1565PB支撑AI发展

2026年7月20日 · admin
openmagic ad

据央视新闻从国家数据局了解到,截至今年6月底,我国已建成高质量数据集12万个,覆盖科学研究、工业制造、医疗卫生、教育教学等多个行业领域,总体量超过1565PB。来源显示,这一规模较一季度末增长超过60%,现有体量约相当于中国国家图书馆数字资源总量的547倍。对于正在快速扩张的人工智能产业而言,高质量、可用、可持续供给的数据资源正在成为模型训练、行业应用落地和智能化升级的重要基础设施。

高质量数据集建设进入加速期

国家数据局披露的信息显示,我国正在持续加大优质数据供给力度。与过去强调数据“有多少”不同,面向人工智能的产业需求,高质量数据集更强调数据的规范性、可用性、场景适配能力以及后续治理能力。特别是在科研、制造、医疗、教育等领域,数据往往具有较高专业门槛,能否形成结构清晰、标注准确、权限合规的数据集,直接影响模型训练效果和应用可靠性。

从规模看,1565PB以上的数据体量已经显示出明显的基础设施属性。对于大模型和行业模型来说,通用语料之外,来自真实产业场景的专业数据尤其关键。例如工业制造中的设备运行、质检、工艺参数,医疗卫生中的影像、病历和诊疗知识,教育教学中的课程、题库和学习行为数据,都可能成为垂直模型能力提升的重要来源。

  • 全国已建成高质量数据集12万个,覆盖多个重点行业领域。
  • 截至今年6月底,总体量超过1565PB,较一季度末增长超过60%。
  • 七个数据标注先行先试城市标注规模超过119PB。
  • 数据标注从业人员已达14万人,产业支撑能力持续增强。

数据标注产业成为AI基础环节

来源显示,四川成都、辽宁沈阳、安徽合肥、湖南长沙、海南海口、河北保定、山西大同七个数据标注先行先试城市,截至今年6月底标注规模超过119PB,数据标注从业人员达到14万人。这表明围绕人工智能的数据生产链条正在从分散化、项目化,走向更具规模化和专业化的产业形态。

数据标注并不只是简单地“给数据打标签”。在大模型、多模态模型和行业智能体发展过程中,标注工作涉及文本、图像、语音、视频、传感器数据等多种类型,还需要结合行业知识进行清洗、分类、质检和安全处理。标注质量会直接影响模型对事实、场景和边界条件的理解,进而影响模型在医疗、工业、教育等高敏感场景中的可用性。

影响解读:从算力竞争走向“数据—模型”闭环

过去两年,AI产业竞争的焦点常被放在模型参数、算力集群和推理成本上。但随着大模型进入行业应用阶段,数据供给的重要性正在显著上升。国家数据局提出,下一步将深化构建服务人工智能的高质量数据供给体系,以模型应用牵引数据供给、以数据驱动模型迭代,并推动实现数据集有偿使用的价值闭环。

这意味着,数据不再只是模型训练前的原材料,而可能成为贯穿模型开发、评测、部署和持续优化的核心资产。对于企业而言,谁能把业务流程中的数据沉淀为可治理、可授权、可复用的数据集,谁就更有机会在行业AI应用中形成差异化壁垒。对于模型厂商而言,单纯依赖公开数据和通用能力的路径将面临上限,与产业数据供给方建立合规、可持续的合作机制会变得更加关键。

从更长周期看,高质量数据集建设还可能推动数据要素市场进一步成熟。当数据集能够通过有偿使用形成价值回收,数据采集、治理、标注、评测、安全合规等环节就有望形成更清晰的商业闭环。这对AI创业公司、行业软件厂商、科研机构以及地方数字产业集群都具有现实意义。

总体来看,全国高质量数据集规模快速增长,说明我国AI发展正在从“模型能力突破”进一步转向“数据、算力、算法和应用场景协同”。在大模型落地进入深水区后,高质量行业数据的供给能力将成为决定AI应用深度和产业效率提升的重要变量。