智算基础设施:三段独立的 GPU 计算系统
NIO · 2022.01–2022.10 / 2023.10–2024.02 / 2025.05–2025.10 · 已上线
这是个什么项目
蔚来的智算中心面向集团内部提供 GPU 算力。这个案例里包含三段独立的系统建设——2022 年的 Nomi 大模型在线推理平台、2023–2024 年的智驾发版评测加速、2025 年的万卡训练集群架构重构。它们发生在不同时期,面对不同的业务问题,唯一的共同点是都落在 GPU 计算基础设施这个域里,覆盖了在线推理、离线计算、大规模集群管理三个层次。
三段系统要解决的核心问题各不相同:大模型推理的资源模型和传统服务不一样,怎么调度;发版评测是硬卡点,怎么在固定窗口内把吞吐提上去;多集群资源割裂,怎么统一成一张资源网。每一段都是一个独立的系统级问题,不是一条连续的平台建设故事。
底层工具——KServe、HAMI、Kubernetes——都是现成的。这些项目的价值不在于发明工具,而在于识别问题、设计工具的使用方式、然后推动它在真实生产环境里落地。
系统长什么样
智算中心 · 三段独立的 GPU 计算系统 ┌──────────────────────────────────────┐ │ 一、在线推理 · 2022 │ │ Nomi 大模型推理平台 0→1 │ │ 自研并发额度调度器 / KServe / HAMI vGPU│ │ → 20+ 业务 · FT ~30ms · 260→140 GPU │ ├──────────────────────────────────────┤ │ 二、离线计算 · 2023–2024 │ │ 智驾发版评测加速 │ │ 数据预取解耦 / 计算图拆分缓存 / 高密度执行│ │ → 8h→4h · GPU 减半 │ ├──────────────────────────────────────┤ │ 三、集群管理 · 2025 │ │ 万卡训练集群架构重构 │ │ 统一管理服务 / 资源编目 / 跨集群调度 │ │ → 吞吐翻倍 · 资源跨集群流通 │ └──────────────────────────────────────┘
项目规模
- 时间:2022.01–2025.10,分三段
- 系统:3 个独立系统,在线、离线、集群管理
- 业务覆盖:在线推理扩展到 20+ 业务
- 集群规模:万卡级 GPU
- 团队协作:在线 4–8 人;离线联合感知团队;vGPU 3 人协作,多集群重构独立完成
核心问题清单
① 怎么为大模型推理设计符合其资源模型的调度系统?
→ 传统负载均衡按 QPS 分发,大模型推理按并发额度占位,以槽位调度。
② 怎么在固定交付窗口内提升离线评测吞吐?
→ 发版评测是硬卡点:每批 10 万 clip、每日多版本,消除重复计算。
③ 怎么把割裂的万卡集群统一成一张资源网?
→ 多地域、K8s 版本各异,各自维护资源池与调度,抽象共性能力。
我的职责
在线推理任项目负责人,带领 4–8 人,不写推理代码,负责方案和需求转化;离线评测主导方案并协同感知团队;万卡集群 vGPU 3 人协作,多集群架构独立重构。
关键结果
在线推理
- Nomi 平台 3 个月从 0→1 上线,扩展到 20+ 业务;首 Token 约 30ms(同期行业基准约 150ms)。
- HAMI vGPU 治理后,推理 GPU 从 260+ 张降到 140+ 张。
离线评测
- 同样 10 万条数据,端到端耗时从约 8 小时降到约 4 小时,GPU 计算资源减半。
万卡集群
- 单位时间吞吐量翻倍;资源可在多集群间流通,消除结构性浪费。