智算基础设施:三段独立的 GPU 计算系统

NIO · 2022.01–2022.10 / 2023.10–2024.02 / 2025.05–2025.10 · 已上线

这是个什么项目

蔚来的智算中心面向集团内部提供 GPU 算力。这个案例里包含三段独立的系统建设——2022 年的 Nomi 大模型在线推理平台、2023–2024 年的智驾发版评测加速、2025 年的万卡训练集群架构重构。它们发生在不同时期,面对不同的业务问题,唯一的共同点是都落在 GPU 计算基础设施这个域里,覆盖了在线推理、离线计算、大规模集群管理三个层次。

三段系统要解决的核心问题各不相同:大模型推理的资源模型和传统服务不一样,怎么调度;发版评测是硬卡点,怎么在固定窗口内把吞吐提上去;多集群资源割裂,怎么统一成一张资源网。每一段都是一个独立的系统级问题,不是一条连续的平台建设故事。

底层工具——KServe、HAMI、Kubernetes——都是现成的。这些项目的价值不在于发明工具,而在于识别问题、设计工具的使用方式、然后推动它在真实生产环境里落地。

系统长什么样

智算中心 · 三段独立的 GPU 计算系统
┌──────────────────────────────────────┐
│  一、在线推理 · 2022                   │
│  Nomi 大模型推理平台 0→1              │
│  自研并发额度调度器 / KServe / HAMI vGPU│
│  → 20+ 业务 · FT ~30ms · 260→140 GPU  │
├──────────────────────────────────────┤
│  二、离线计算 · 2023–2024              │
│  智驾发版评测加速                     │
│  数据预取解耦 / 计算图拆分缓存 / 高密度执行│
│  → 8h→4h · GPU 减半                   │
├──────────────────────────────────────┤
│  三、集群管理 · 2025                   │
│  万卡训练集群架构重构                  │
│  统一管理服务 / 资源编目 / 跨集群调度   │
│  → 吞吐翻倍 · 资源跨集群流通           │
└──────────────────────────────────────┘

项目规模

  • 时间:2022.01–2025.10,分三段
  • 系统:3 个独立系统,在线、离线、集群管理
  • 业务覆盖:在线推理扩展到 20+ 业务
  • 集群规模:万卡级 GPU
  • 团队协作:在线 4–8 人;离线联合感知团队;vGPU 3 人协作,多集群重构独立完成

核心问题清单

① 怎么为大模型推理设计符合其资源模型的调度系统?
 → 传统负载均衡按 QPS 分发,大模型推理按并发额度占位,以槽位调度。

② 怎么在固定交付窗口内提升离线评测吞吐?
 → 发版评测是硬卡点:每批 10 万 clip、每日多版本,消除重复计算。

③ 怎么把割裂的万卡集群统一成一张资源网?
 → 多地域、K8s 版本各异,各自维护资源池与调度,抽象共性能力。

我的职责

在线推理任项目负责人,带领 4–8 人,不写推理代码,负责方案和需求转化;离线评测主导方案并协同感知团队;万卡集群 vGPU 3 人协作,多集群架构独立重构。

关键结果

在线推理

  • Nomi 平台 3 个月从 0→1 上线,扩展到 20+ 业务;首 Token 约 30ms(同期行业基准约 150ms)。
  • HAMI vGPU 治理后,推理 GPU 从 260+ 张降到 140+ 张。

离线评测

  • 同样 10 万条数据,端到端耗时从约 8 小时降到约 4 小时,GPU 计算资源减半。

万卡集群

  • 单位时间吞吐量翻倍;资源可在多集群间流通,消除结构性浪费。

阅读实施记录 →