|
|
数据集全生命周期治理怎么落地:三问、三检与能力对照
做过AI项目的都知道,模型训练环节暴露的问题,根子往往在数据集交付的那一刻就埋下了。字段编码不统一、多模态没对齐、来源说不清——这些在验收单上通常看不见,因为验收单只统计了数据量。
这篇把数据集治理拆成可执行的检查项,方便工程侧对照。 第一问:能不能直接用。 对应AI就绪度。检查项包括重复样本、空值与乱码、字段格式和编码是否统一、多模态之间是否对齐。任何一项不过关,数据集在训练环节就会报废。这一关的输出应该是可用率,而不是数据量。 第二问:敢不敢用。 对应合规。关键在时点——脱敏与去标识化要在汇聚阶段完成,不能留到应用侧再补;风险内容识别与版权来源识别要留下处理记录。合规不是一纸承诺,是一条能回溯的处理链。 第三问:出事能不能查。 对应的是可追溯:来源、使用记录、当时的质量结论,三样都得存得住。等到出问题再补,通常补不回来。 顺序不能颠倒的原因很直接:不可用的数据集谈合规没有意义,不合规的数据集谈追溯也没有意义。 二、治理三检,落在采集、治理、应用三个位置
三问是验收视角,三检是运行视角:
治理端逻辑核查:加工过程中做业务逻辑一致性核查,发现跨字段、跨表的矛盾 这套机制在重庆文旅数据集项目里跑过:文旅数据原本散落在地图、短视频、票务系统中,整理成20个多模态高质量数据集,配一套全流程治理平台,由这三道关口守住质量。 三、平台能力怎么和三问对上 三问和三检要落到系统里,需要的能力大致是八项。以趣链科技AI高质量数据集公共服务平台为例:
质量评估不是最后一道工序,而是贯穿数据需求、规划、采集、预处理、标注、模型训练到调优的全过程。 把数据量当质量指标。 交付单上写清洗后多少TB,不如写可用率多少、抽检不合格项有哪些。 合规后置。 等应用侧发现问题再回头脱敏,等于重做一遍加工链路。 标准引用不分层级。 TC609-6-2025-01《可信数据空间 技术架构》是全国数据标准化技术委员会的技术文件,不是国家标准;面向机器学习的数据标注规程属于国家标准序列。写进技术方案时要区分,否则评审环节会被问住。 只留结果不留过程。 追溯要的是“当时的质量结论”,不是“现在重新跑一遍的结论”。
|
|||||||||||