
大模型的竞争到 2026 年拼的不再只是参数和算力,是数据。
「高质量数据集」已经不是技术圈的行话——它是写进国家文件的政策术语,有官方定义、有打分标准、有建设流程。国家数据局局长刘烈宏在 2026 年 3 月的国新办发布会上说了一句定调的话:2026 年是数据要素价值释放年。
这篇文章把三件事讲清楚:高质量数据集是什么、怎么评、怎么建。我用一套「遥感影像土地分类数据集」贯穿全篇——卫星影像加地块标注,从定义到打分到建管线,同一个例子不换,让抽象标准始终有具象载体。
读完你能拿走一张完整的认知地图:一个定义、三维度评测、五步建设。
1. 政策为纲:一条时间线讲清国家在推什么
高质量数据集不是一天冒出来的概念。从 2022 年到 2026 年,国家政策链一步步把它从「数据要素」的宏观愿景推到了「怎么建、怎么评、怎么挂牌交易」的工程细节。我压成一条时间线: 
三个数字标记这条时间线的进度:截至 2026 年 6 月,「数据要素×」三年行动累计发布 417 个典型案例、覆盖 760 个细分场景指引(原定目标 300 个,已超额完成);全国活跃数据总量达 1.67 ZB,同比增长约 28.46%。
2. 是什么:官方定义拆解
2026 年 6 月那份实施方案(国数科基〔2026〕25 号),给了一个正式定义——
行业高质量数据集:经采集、加工等处理,可直接用于开发和训练 AI 模型,能有效提升模型性能的行业数据集合。
拆成三句:
- 经过处理:不是原始数据直接拿来用,要有采集、加工的流程。
- 可直接训练:不是「存起来以后再说」的数据仓库,是能直接喂给模型的。
- 以提升性能为验收标准:好不好不是人眼说了算,是模型效果说了算。
这个定义里还区分了两类数据集:行业通识(行业通用知识,如通用语料、基础图像)和行业专识(行业专有知识,如医疗影像标注、金融交易流水)。前者覆盖面广、后者壁垒深,建设路径不同。

和「干净的数据仓库数据」有什么区别?
区别一句话:验收标准不同。
数据仓库的验收标准是「完整、一致、不丢不重」——ETL 跑通、报表出得来就行。高质量数据集的验收标准多了一层:拿进模型训练,模型性能要涨。数据再干净,喂给模型不管用,就不算「高质量」。
这正是评测规范把「模型应用」单列为一个维度的原因——后面第 3 节展开。
实例登场:一套土地分类数据集
为了让后面的定义拆解、评测打分、建设流程都有具象载体,我引入一个贯穿全篇的例子:遥感影像土地分类数据集。
它的构成很简单:
- 影像数据:多期高分辨率卫星影像(如高分系列、Sentinel-2),覆盖目标区域的不同季节、不同光照条件。
- 标注数据:每个地块的多边形边界(矢量标注)+ 分类属性(耕地、林地、建设用地、水体、裸地等),遵循国家土地利用分类标准(GB/T 21010)。
- 元数据:影像获取时间、传感器类型、空间分辨率、坐标系、标注规范版本。
对照官方定义逐条过:它经过了辐射校正、云掩膜、切片等处理(经过处理 ✅);切片和标注可以直接组成训练样本喂给语义分割模型(可直接训练 ✅);模型在验证集上的 mIoU(平均交并比)就是它的验收指标(以提升性能为验收标准 ✅)。
它同时包含两类:基础地物样本(耕地、林地、水体)属于行业通识——任何遥感模型都需要;而特定区域的细粒度分类(如区分水田和旱地、识别大棚与露天种植)属于行业专识——只有深耕该区域的模型才用得上。
3. 怎么评测:三维度打分,90 分才算合格
高质量不等于「干净的数据」。
这是评测规范给出的最重要判断。《高质量数据集质量评测规范》构建了一个三维度评价体系,三个维度分别百分制打分,三个维度均 ≥90 分才算高质量数据集。

维度一:说明文档
数据集有没有配套文档?文档写没写清楚数据来源、字段含义、使用限制、版本记录?
这个维度评的是可理解性和可复用性。一套没有文档的数据集,就像一本没有目录、没有前言的书——翻得开,读不懂。
土地分类实例:文档里有没有写清楚影像来源(高分二号还是 Sentinel-2)、空间分辨率(0.8m 还是 10m)、分类体系依据(GB/T 21010-2017 哪一版)、标注工具版本、标注人员资质?缺一项就扣分。
维度二:数据质量
这是最接近传统「数据质量」概念的维度,包含四个子指标(据36 氪报道及规范征求意见稿):
| 准确性 | 标注是否正确 | 标注员把一片建设用地的边界画歪了 30 米,模型学到了错误的空间特征 |
| 完整性 | 样本是否覆盖所有场景 | 缺少云遮挡区域的样本,模型遇到多云天气就性能暴跌 |
| 时效性 | 数据是否足够新 | 用 2021 年的影像训练模型去判读 2026 年的地块——三年间大量农田已变成住宅区 |
| 一致性 | 标注规范是否统一 | A 标注员把「大棚」归入建设用地,B 标注员归入耕地,同一类地物两种标法 |
维度三:模型应用
这是评测规范最关键的设计——数据好不好,最终由模型说了算。
把数据集拿进实际的模型训练流程,看模型效果指标是否达标。不是人眼审查「标注看起来对不对」,是模型跑出来的 IoU、F1、准确率实打实地说话。
土地分类实例:把数据集喂给一个 U-Net 或 DeepLabV3+ 语义分割模型,在留出的验证集上测 mIoU。如果 mIoU 只有 65%(行业一般要求 80% 以上),那即使标注看起来工整、文档写得漂亮,模型应用这个维度也过不了 90 分。
这就是「高质量 ≠ 干净」的出处——数据在统计层面可以是完美的(无缺失、无重复、格式统一),但在模型训练层面可能不够用(特征不够区分、样本分布偏斜、标注粒度与模型需求不匹配)。
三维度均 ≥90 分,缺一不可
这个门槛设计得很硬。不是加权平均 90 分就行,是三个维度分别都要到 90 分以上。意思是:
- 文档写得好但数据质量差——不通过。
- 数据质量好但模型跑不出效果——不通过。
- 模型效果好但文档缺失、别人用不了——不通过。
规范还设计了四阶段认证流程(据 36 氪报道):自评 → 第三方评测 → 专家评审 → 认证发证。不是自己说好就行,要过外部关。
4. 怎么建:五步法落地
信通院《人工智能高质量数据集建设指南》(2025-08)和国家数据局实施方案共同指向一个建设框架。我把它压成工程侧可落地的五步:数据设计 → 采集汇聚 → 预处理 → 标注 → 质检。
每步我都落在土地分类管线上,让抽象流程变成可执行的工序。

第一步:数据设计——定分类体系与覆盖区域
这一步决定数据集「建什么」。
土地分类管线:先确定分类体系。是按国标 GB/T 21010 的一级类(12 类)还是二级类(73 类)?目标区域选哪几个省、覆盖哪些典型地貌(平原、丘陵、城市、海岸带)?需要多少期影像(至少覆盖春夏秋冬四季,捕捉作物生长周期)?
设计阶段还要定下几个工程参数:空间分辨率要求(0.5-2m 高分还是 10m 中分辨率)、最小标注面积(小于多少平方米的地块要不要标)、类别样本量的最低配额(每类至少多少张,防止长尾分布把小类淹没)。
这一步做不好,后面全在填坑。分类体系没定清楚就开始标注,标到一半发现「大棚」和「温室」要不要分两类争论不休,推倒重来成本巨大。
第二步:采集汇聚——多期影像到手
这一步解决「原料从哪来」。
土地分类管线:从高分专项、Sentinel-2、Landsat 等数据源获取目标区域的多时相影像。关键工程细节:
- 多时相:同一区域至少 4 期影像(四季各一期),捕捉地物随时间的变化。耕地的光谱特征在播种期和收割期截然不同,只拿一季影像训练出的模型泛化性极差。
- 多源融合:高分影像(0.8m)提供空间细节,Sentinel-2(10m,5 天重访)提供时间密度。两者配准后互补。
- 数据合规:涉密区域影像要脱密处理,商业卫星影像要确认使用授权。
第三步:预处理——辐射校正、云掩膜、切片
原始影像不能直接用。这一步是把「原料」加工成「可用素材」。
土地分类管线,三件核心工序:
辐射校正:不同时间、不同传感器拍到的影像,亮度值不可直接比较——大气散射、太阳高度角、传感器老化都会让同一块地看起来不一样。辐射校正把这些干扰因素消除,让像素值反映地物的真实反射率。方法包括绝对辐射校正(利用大气参数反演)和相对辐射校正(以某一期为基准,其他期对齐)。
云掩膜:光学遥感最大的敌人是云。云覆盖区域的地面信息完全丢失,如果不剔除,模型会把白色云层学成「雪」或「裸地」。云掩膜算法(如 Fmask、S2Cloudless)识别云和云影,把对应像素标记为无效。
切片:卫星影像动辄几万×几万像素,模型吃不下。切成 256×256 或 512×512 的小块(patch),每块带上对应的标注掩膜(mask),组成训练样本。切片时要注意边界效应——地块被切割线一分为二,标注边界会不完整,通常用重叠切片(overlap 32-64 像素)+ 推理时拼接来解决。
第四步:标注——画地块边界、配分类属性
这一步把影像变成「有答案的考题」。
土地分类管线:标注员在影像上沿地块边界画多边形(矢量标注),每个多边形赋予一个类别属性。标注工具常用 Labelme、QGIS 或自研平台。
几个工程关键点:
- 人机协同:先让预训练模型跑一轮自动分割(如 SAM、DeepLab),标注员在此基础上修正,效率比纯手工高 3-5 倍。国家数据局发布的典型案例集里,自然资源遥感智能解译数据集就采用了这种「智能标注 + 人机协同」模式(据自然资源部报道)。
- 标注规范文档化:什么情况算「耕地」、什么算「园地」、大棚归哪类、撂荒地归哪类——每种易混淆情况都要在标注手册里配图说明,并附判定决策树。
- 标注一致性检查:同一地块让两个标注员分别标,算 IoU。一致性低于 85% 的类别要回溯规范、重新培训标注员。
这一步呼应我之前的文章《训练数据集长什么样》里讲过的一个观点:loss mask 机制下,模型只对「答案部分」算损失——标注的质量就是模型真正吃进去的东西,标注画错一个像素,loss 就多算一个像素的误差。
第五步:质检——抽样复核 + 模型回测闭环
最后一步是闭环验收,也是最容易被省略的一步。
土地分类管线,质检分两层:
人工抽样复核:从标注结果中随机抽 5%-10% 的样本,由资深标注员或领域专家复核。复核指标:边界偏差(标注边界与实际地物边界的像素偏移量)、类别错误率、遗漏率。偏差超过阈值(如边界偏移 >3 像素、类别错误率 >5%)的批次退回返工。
模型回测:把数据集喂给一个基线模型(如 DeepLabV3+ with ResNet-101),在留出的验证集上测 mIoU、各类别 IoU、混淆矩阵。这是最终验收——如果模型在耕地上的 IoU 有 92% 但在建设用地上只有 68%,说明建设用地的标注有问题或样本不够,要回到标注步骤定向补强。
模型回测是质检里最值钱的一环。它对应的就是评测规范里「模型应用」那个维度——数据好不好,不是标注员说了算、不是项目经理说了算,是模型跑出来的数字说了算。
5. 技术深挖(可跳过):面向智能体的数据集与资产化试点
这一节放几个前沿方向,感兴趣就读,跳过不影响主线。
面向智能体应用的高质量数据集
国家数据局 2026 年委托研究课题里,有一个方向是「面向智能体(Agent)应用的高质量数据集建设」。传统数据集是给单个模型训练用的,智能体场景下的数据集需要考虑多轮对话、工具调用轨迹、任务规划路径等新型数据形态。这和本系列之前讲过的 Function Calling(《从「会说」到「能伸手做事」那篇讲过,模型输出「我要调 tool_x」再由外部代码执行的循环)以及 RAG(《查不到就喂给它看》那篇讲过的检索-增强-生成)直接相关——Agent 的训练数据不只是文本对,而是「思考-调用-结果-反思」的完整轨迹。
数据集资产化试点
2026 年实施方案提出了数据集资产「盘点 → 登记 → 评估」的试点路径。意思是:高质量数据集不只是技术资产,还要变成可计量、可交易的资产。这和会计准则里的无形资产评估接轨——数据集有建设成本、有预期收益、有使用年限,可以进资产负债表。
合成数据与质量的关系
合成数据(Synthetic Data)在 2025-2026 年持续升温。对土地分类来说,可以用生成模型(如扩散模型)合成不同光照、不同季节的影像来扩充稀缺样本。合成数据解决的是「完整性」问题(评测维度二的子指标),但它不能替代真实标注——合成数据的质量上限受生成模型本身的限制,评测时同样要过三维度打分。
6. 结论:一个定义、三维度、五步法
回到开头那句话:大模型的竞争到 2026 年拼的是数据。
但「数据」不是随便堆的。国家已经给出了完整的框架:
| 一个定义 | 经采集加工、可直接训练 AI、以提升模型性能为验收标准的数据集合 |
| 三维度评测 | 说明文档(可理解)+ 数据质量(准确/完整/时效/一致)+ 模型应用(效果达标)——三维度分别 ≥90 分 |
| 五步建设 | 设计 → 采集 → 预处理 → 标注 → 质检,质检不合格回到标注返工 |
我用同一套土地分类数据集走完了全流程:定义对照(影像+标注,可直接训练,mIoU 验收)、评测演示(标注边界画错扣准确性、缺云区样本扣完整性、旧影像判新地块扣时效性、IoU 不达标扣模型应用)、建设落地(分类体系→多期采集→辐射校正云掩膜切片→地块标注→抽样复核+模型回测)。
如果只让我留一句:数据质量的终判权不在人眼,在模型。 标注看起来再工整,模型跑不出效果就是不合格——这是 2026 年国家标准最值钱的一条判断。
最后,送你高质量数据集建设全景图: 






