数据生产体系重构:从人工三个月到自动七天
NIO · 2022.10–2023.09 · 已上线
这是个什么项目
智驾训练数据是非结构化的,散落在文件系统里,格式不统一。生产流程靠人工串联十几个环节,一条数据从需求到进入训练约三个月。数据从几百 TB 增长到 PB 级后,纯文件管理和人工流程都撑不住。项目重做整个智驾研发体系的训练数据生产链路。
系统重建为两层:数据管理中心让数据“有身份”——格式、粒度、存储、读取接口四层标准化,唯一 ID 作为全生命周期锚点,按内容哈希去重;数据生产中心让流程自动流转——Event-Trigger 串联环节,统一调度接口接入不同服务与任务,数据血缘随生产形成。为应对存储打满,还完成视频训练改造与 MPI 执行引擎,后续支撑大模型数据交付。
这不是一个转换工具。数据标准要成为团队间的交换协议,需要组织采纳并迁移;链路自动化要求完整理解生产流程。视频训练没有先例、只有两周窗口,格式复杂、算力稀缺。
系统长什么样
┌──────────────────────────────────────────────────┐
│ 数据管理中心 │
│ 标准化四层 / 唯一 ID / 哈希去重存储 │
└────────────────────────┬─────────────────────────┘
▼
┌──────────────────────────────────────────────────┐
│ 数据生产中心 │
│ Event-Trigger 自动串联 / 统一调度接口 / 数据血缘│
└────────────────────────┬─────────────────────────┘
▼
┌──────────────────────────────────────────────────┐
│ 执行与交付 │
│ 视频训练改造:存储 -95% / MPI 引擎:两周千万份 │
└──────────────────────────────────────────────────┘
生产周期:人工约 3 个月 → 自动约 7 天
项目规模
- 时间:约一年(2022.10–2023.09)
- 团队:3–5 人平台研发,我任团队负责人
- 数据规模:训练数据约 2 PB,千万份级
- 背景体量:改造前高清 JPEG 占满百 PB 级存储
- 覆盖范围:整个智驾研发体系的训练数据生产全流程
- 协作:视频训练改造联合感知团队;海外数据链路与 leader 共同完成
核心问题清单
① 怎么让 PB 级、散落在文件系统里的训练数据变成标准化、可交换的组织资产?
→ 四层标准化 + 唯一 ID + 哈希去重存储;标准后来成为团队间的数据交换协议。
② 怎么把十几个靠人工衔接的处理环节变成一条自动流水线?
→ 用 Event-Trigger 将环节完成转化为下一环节触发,以统一调度接口接入不同服务与任务,产出标准数据集。
③ 存储即将打满、训练不能停,怎么在两周内完成没有先例的视频训练改造?
→ 平台侧完成格式统一,训练代码无需感知编码细节;MPI 引擎以单机多进程压榨算力。
我的职责
作为数据生产团队负责人(3–5 人):主导数据管理中心架构、API、数据结构与用户 SDK 设计;主导数据生产中心设计与开发(与一名研发);独立完成视频训练改造(约一周)与 MPI 执行引擎;负责大模型百万份数据的格式重构与交付;与 leader 共同设计海外数据链路。
关键结果
- 数据管理中心上线后接管整个智驾研发体系的训练数据,成为训练数据生产的唯一通道;数据标准在此后几年成为组织间交换的标准形式,唯一 ID 成为全生命周期的稳定锚点。
- 生产周期:单条数据从需求到训练就绪,从人工约 3 个月压缩到自动约 7 天。
- 视频训练改造(行业首个):存储占用减少约 95%,数据加载效率提升 110%,按存量数据节省存储成本约 3000 万元。
- MPI 引擎两周内完成千万份数据处理、效率提升 3 倍,随后复用于大模型约百万份数据交付;海外数据链路回国带宽打满 5 Gbps、成本节省约 75%。