训练与后训练系统:从跑通训练到看清模型
补天石 · 2025–2026 · 核心已上线
这是个什么项目
Research Box 的训练能力按 5 台 GPU 以下的小场景规划。进入 VLA 训练后,公司需要面向更大规模、异构算力的训练基础设施。目标不是“帮用户起一个 Pod”,而是让训练成为平台可以理解、管理、追踪的对象。训练系统建成后,问题又向前推进:模型训出来到底行不行,于是延伸出后训练评测闭环。
训练侧以 K3s 和 GPU 纳管为基础,运行时采用 Sidecar 优先、Standard Image 兜底、PID 1 支持特定场景。Training SDK 输出 Metrics、Artifact、Model;Job → Artifact → Model 携带代码版本、镜像、超参、数据集与 Metrics,可追溯。后训练侧包括 MLflow 与指标对比,以及录制视频后由 VLM 判定 Success / Failure。失败分类与数据回流仍在设计推进。
底层算力从裸金属到纯 Container 形态各异,平台既要控制训练生命周期,也不能绑架用户环境。让模型从孤立文件变成能回答“怎么训出来的”对象,需要 SDK 与平台协同设计。评测中的第一人称视角不足等问题,也只有链路跑起来才会显形。
系统长什么样
训练基础设施
┌──────────────────────────────────────────┐
│ 用户层:Training SDK │
│ Metrics / Artifact / Model │
└────────────────────┬─────────────────────┘
▼
┌──────────────────────────────────────────┐
│ 运行时层:Sidecar 优先 / Standard Image 兜底│
│ PID 1 特定场景 │
└────────────────────┬─────────────────────┘
▼
┌──────────────────────────────────────────┐
│ 存储层:用户工作空间 + S3 数据集挂载 │
└────────────────────┬─────────────────────┘
▼
┌──────────────────────────────────────────┐
│ 调度层:K3s + GPU 纳管 │
└──────────────────────────────────────────┘
追溯链路:Job → Artifact → Model(携带完整训练上下文)
后训练:真机执行 → 录制视频(第一人称 + 第三人称设计)
→ VLM 判定 Success / Failure
→ 失败分类 / 数据回流(设计方向)
用户:2 名算法研究员 · 累计 30–50 次真实 VLA 训练
项目规模
- 时间:PoC 到工程化约 2–2.5 个月,后续持续演进
- 团队:PoC 单人完成;工程化阶段我 + 2 名系统研发 + 1 名 Infra 研发
- 用户:2 名算法研究员,专门训练 VLA 大模型
- 训练量:累计约 30–50 次真实训练任务
- 当前状态:训练核心 + MLflow + Metrics 已落地;真机评测基线在 Demo 跑通;第三人称视角 / 失败分类 / 数据回流推进中
核心问题清单
① 底层算力形态不受控,平台怎么既保持对训练生命周期的控制、又不绑架用户的训练环境?
→ Sidecar 优先、Standard Image 兜底、PID 1 作为特定场景能力;按对用户的侵入性排序,而不是按平台控制力排序。
② 怎么让训练成为可理解、可追溯的对象,而不是“提交 Job 等结果”的黑盒?
→ Training SDK 输出 + 完整上下文记录:每个模型都能回答“我是怎么训练出来的”。
③ 模型训出来到底行不行,怎么建立可持续的评测?
→ 先建立粗粒度基线(Success / Failure + VLM 自动判定),让链路暴露下一层问题(第一人称视角不够 → 补第三人称)。
我的职责
独立完成 PoC 全链路(GPU → 存储 → Training Job → SDK → Metrics → Artifact → Model),担任训练系统架构与方案 Owner,亲自实现 Training SDK,设计 Runtime 分层并实现控制与关联逻辑;设计 MLflow / Metrics 与边缘计算架构方案,正式版核心业务代码主要由团队实现。后训练部分,确立“Research 体验优先”方向,推动真机评测基线落地。
用户使用情况
- 2 名算法研究员的真实 VLA 训练全部走平台路径,累计约 30–50 次训练任务,没有因运行时限制而绕开平台。
- “训练 → 模型 → 端侧推理”跑通;模型携带完整训练上下文,可追溯。一键复现未实现。
- MLflow + 指标对比进入研究员日常研发;真机评测基线在 Demo 跑通,第一人称视角不足已写入方案。
- 当前边界:第三人称视角部署、失败分类与数据回流自动化推进中;机器人本体部署落地中;边缘训练仅做架构验证,未大规模生产验证。