新媒体矩阵

全国高质量数据集半年扩容60%(突破1565PB)竞争转向数据供给侧

截至2026年6月底,全国已建成覆盖科学研究、工业制造、医疗卫生、教育教学等领域的高质量数据集共12万个,总体量突破1565PB。

7月18日,国家数据局在2026世界人工智能大会语料创新论坛上宣布:截至2026年6月底,全国已建成覆盖科学研究、工业制造、医疗卫生、教育教学等领域的高质量数据集共12万个,总体量突破1565PB,较一季度末增长超60%,体量约为中国国家图书馆数字资源总量的547倍。

9e1c54b049c1e879b1169b1e8f0af003.jpg

本次纳入统计的高质量数据集,特指经过采集、清洗、标准化校验与标注加工、可直接用于人工智能模型训练的数据资源,区别于未处理的原始数据。原始数据存在格式不统一、标注缺失、噪声较多等问题,无法直接用于大模型训练,但经过加工的高质量数据集,可有效降低模型训练中的幻觉概率,提升模型在垂直行业的输出准确率。

目前全国共确定成都、沈阳、合肥、长沙、海口、保定、大同七座数据标注先行先试城市。截至6月底,七座城市累计完成标注数据规模超119PB,直接服务425个大模型研发项目,带动相关产业产值263亿元。各城市依托本地产业基础形成差异化分工,如沈阳主攻工业数据标注,合肥聚焦语音数据赛道,长沙以音视频与文创数据为特色,成都侧重标注技术平台的研发与搭建。

高质量数据集规模半年内增长超60%,由供需两端共同拉动。需求端,大模型正从通用场景向工业、医疗、教育等垂直行业加速落地,对细分领域的专业训练数据需求快速增长;供给端,公共数据授权运营试点持续推进,行业间数据共享机制逐步建立,加上合成数据技术的补充,数据供给渠道持续拓宽。

6月上旬,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》,进一步明确了建设路径与目标。

方案提出实施六项专项行动,覆盖数据供给全流程。强基扩容行动聚焦19个重点领域与5个创新领域,扩充数据集覆盖范围与总量;标注攻坚行动推动标注技术迭代与产业集聚,提升标注效率与精度;提质增效行动建立统一的质量分级与验收标准;应用赋能行动推动数据集与产业需求对接;管理服务行动搭建全生命周期追溯体系,落实数据产权分置要求;价值释放行动探索数据资产入账、交易定价的可行模式。

关于数据在人工智能发展中的作用,行业观察人士表示,模型架构与算力水平决定了模型逼近能力上限的速度,训练数据的质量则直接决定智能能力的上限。专家提出,在具身智能领域,除常规成功案例数据外,真机操作数据、人类施教数据、仿真合成数据,甚至任务失败的数据,都对模型稳定性提升有实际价值。

当前高质量数据集建设仍存在多处堵点。数据要素的权益分配规则、跨行业共享机制、安全合规流程尚未完全统一,数据价值评估缺乏通用标准,数据从资源转化为可流通资产的路径尚未完全打通。

按照实施方案的规划,到2028年底,我国将建成一批覆盖重点领域、经过实际应用验证的行业高质量数据集,形成数据供给与产业应用相互带动的循环机制。

底部.png

评论 0