职业摘要

12 年软件与基础设施研发经验,长期围绕数据基础设施、AI 计算系统和数据闭环工作。 先后经历云计算 / 大数据、智能驾驶和具身智能三个阶段:在 NIO 负责过 PB 级训练数据体系、万卡 GPU 计算基础设施与百万车辆边缘计算项目; 近一年在补天石负责具身智能从设备接入、数据采集生产到训练 / 后训练的工程闭环。

工作角色横跨核心研发、系统架构与技术负责人——曾带领约 15 人团队,也长期保持一线系统设计和编码。 擅长接手边界模糊、跨团队、缺少成熟方案的工程问题,将其拆解为可运行、可扩展的生产系统; 主要工作边界集中在数据、计算、设备与 AI 工程基础设施,不以算法模型研发为主。

Capabilities

核心能力

复杂系统落地

端到端系统落地

面对需求尚不清晰、边界尚未定义的场景,快速建立最小可运行系统,在真实业务反馈中逐步收敛架构。

系统判断与架构取舍

  • 架构决策与权衡

    基于现实约束做明确取舍——倾向选择足够好且复杂度低的方案,而不是理论最优方案。

跨层系统设计

  • 软硬件协同

    理解设备端真实约束,跨越软件和硬件的边界做合理的职责划分和系统设计。

  • 数据基础设施

    从协议设计、格式演进、质量管理到大规模数据生产系统,覆盖数据全生命周期。

  • 计算系统设计

    从边缘设备到云端 GPU 到分布式计算,根据工作负载特征选择和设计合适的计算架构。

工程交付与协同推进

  • 跨团队方案推进

    以技术方案为锚点,推进硬件、软件、测试多团队各自的工作,协调联调和上线节奏。

  • 模糊问题落地

    没有成熟组织支撑时,不等人、不等流程、不等完美方案,直接动手把事情跑起来。

贯穿三组支撑能力

AI Native 设计

把 AI 系统化纳入产品和工程流程——不是"加一个 AI 功能",而是重新定义用户与系统的交互关系。

工作经历

Recent Work

上海补天石科技

研发 Leader / 数据负责人

具身智能创业公司,业务覆盖机器人数据采集、训练与后训练基础设施。

  • 负责数据采集与生产、设备接入、训练 / 后训练等核心工程体系的技术方案与落地;
  • 承担软件研发团队技术管理,并跨硬件、算法、产品、运营推进交付;
  • 在早期团队资源有限的情况下保持核心系统 hands-on 开发。

代表项目

  • 客户没有需求文档,只有一句“证明你们真的具备数据闭环能力”。项目要在一个月内把这句话变成可现场运行、可演示的系统——从方案定义到现场部署交付,由我单人完成。

    • 方案与边界:将模糊目标拆解为 24–26 个功能点定义 MVP 边界,与 CTO 对齐;按“验证能力优先”做减法,以每周客户现场演示持续校准方向。
    • 系统建设:搭建 K3s 集群与训练 Pod 调度;机器人以 K3s Worker 接入成为推理节点;完成多视角实时采集与遥操(WebRTC 内网直连)、数据异步落盘 S3、DSL 检索与拖拽重组数据集;以“云控制 / 本地数据面”拆分适配不可控的客户网络拓扑。
    • 结果:一个月内完成开发并现场交付,真实机器人接入客户现场系统,跑通“任务部署 → 遥操 → 多视角采集 → 数据落盘 → 组织检索”全链路;合同 60 万元签约,成为公司首笔商业收入;架构方案成为后续 Research Box 的技术蓝本。
  • 面向 10 人以下具身研发团队,搭建可本地化部署的完整研发平台:覆盖设备接入、机器人对接、数据采集(遥操 / 录制 / 标注)、数据集与血缘、Pipeline、Training SDK、存储与 K3s 集群整条链路。我担任核心研发与整体技术方案负责人,除底层 Infra 与训练调度外的主体建设由我完成(4 人 / 3 个月 / 约 100 万投入),核心技术闭环完成度 90%+。

    • MVP 边界与抽象设计:按目标用户真实场景做主动简化(不做多供应商 / 配额 / 多级质检 / 结算),以“简化的代价在规模变化时是否可控”作为取舍标准——这条判断后来直接影响了采集系统与训练系统的抽象设计。
    • 视频与 ROS 信号解耦:机器人同时产生 ROS 信号与视频,两者数据量级相差近两个数量级;视频不进 ROS Bag,走独立编码落盘,再用 Parquet 时间索引在更高抽象层把两条时间轴重新关联——这套“数据按性质分流、高层重新关联”的思路后来演变为 Manifest 数据抽象层。
    • 边缘算力职责划分:机器人 Orin 只做实时必须的推理 / 采集 / 落盘,LiRobot 格式转换与重计算全部放云端——“边缘算力是硬约束、重计算搬云端”从这里的隐约判断,变成后续设备接入与训练系统的明确原则。
    • 结果与延续:机械臂与机器人真实接入,跑通“注册 → 唤醒 → 数据生产 → 标注 → 入库 → 训练”主路径;代码未被后续系统继承,但数据分流、边缘算力边界、MVP 边界、用户入口优先等设计原则进入此后每一个系统。
  • 公司规模最大的生产系统。从“这个月要采到 100 小时”的 MVP 起步,长成平台、运营、供应商共用的生产管理体系,承载真实生产与结算,也是所有采集数据入库、进入下游的入口。我负责核心机制设计,接手 CTO 主导的重构初版(约两周从“演示可用”推到“生产可用”),并作为主要技术负责人持续演进。

    • 设备无关抽象与采集端:把面向机器人的采集模块改造成通用的“数据创建 / 任务领取 / 数据上传”接口,并完成 Web 前后端与 iOS 采集端的完整实现(登录、任务领取、录制、上传);自研硬件未就绪时 iPhone 直接顶上,采集链路没有被设备绑死。
    • 供应商自治与角色体系:平台只管理供应商一层,供应商自行管理采集员 / 质检员与任务分配;平台管理员、平台质检员、供应商管理员、采集员、质检员多角色在同一套边界内协作,8–12 家供应商规模下没有变形。
    • 批次账单信任机制:把“生产事实 → 质量判定 → 结算事实”三层数据显式关联,做成平台与供应商共享的同一份批次视图(数据总量、逐条审核状态与原因、通过率、应结算金额);“我采了 8 小时你只算 4 小时”式争议在机制层面消失,累计 9 万+ 条、约 5 万小时进入真实结算。
    • 自动质检流水线:在人工质检前加硬前置的五类自动检测——YOLO 手部 / 黑帧 / 静态 / YOLO 人脸(准确率有限,阈值保守、作为人工复核触发器)/ 过曝抖动;把现成模型工程化为可分发、可扩容、可观测的质检流水线,让规模化生产不再靠人堆。
    • Flyte + Ray 常驻计算模式:把 Workflow 从“按需创建”改造成常驻服务——预部署 Workflow、Kafka 触发、按类型分发、Ray 弹性伸缩;独立完成常驻改造、任务分发与服务化封装。上线后 Pod 生命周期类问题(镜像等待、启停开销、资源残留)不再出现;同一认知随后迁移为训练系统的“单 Pod 批量处理”模板。
    • 结果:峰值约 3000 采集小时/天(真实生产最大值,尚未触到系统瓶颈);国内 + 马来西亚同一套系统按配置运行;系统已发展到约 20 个微服务,正在以 gRPC / HTTP 边界治理收敛迭代复杂度。
  • 自研双目设备到手时只能录视频、存内存卡,没有联网与上传能力。项目分两段:先把硬件接入生产系统,再借设备端编码瓶颈重构视频数据基础设施;我作为统一 Owner 负责协议、平台实现与跨端联调(4 人团队)。

    • 设备接入:用二维码把“设备发现 + 网络 / 身份 / 权限下发”合并为一个动作(绕开 iOS 对 Wi-Fi 扫描的严格限制);服务端中转双端状态(约 1s),双向心跳判定设备真实所有者,数据生成时锁定录制身份。
    • 视频数据体系:设备端 H.264 30s 切片 → 2min Chunk 上传 → 云端 Remux 为 MP4 → Manifest 统一新旧数据;固定 GOP / Closed GOP 前置支持切片、局部脱敏与重编码,生产与交付格式分离。
    • 结果:25 台测试机 + 5–10 台样机运行约 1.5 个月(累计几千小时采集);旧上传链路彻底停用,连续录制死机与上传恶化问题消失;历史数万小时旧数据通过 Manifest 在线兼容、零迁移;标定入库固化,数据实现自描述。
  • 为 VLA 训练建设面向异构算力的训练基础设施,让训练成为平台可理解、可追踪的对象,并延伸出后训练评测闭环(单人 PoC 起步,约 2–2.5 个月到工程化版本,工程化阶段 4 人团队推进)。

    • 训练运行时:以 K3s + GPU 纳管为基础,运行时采用 Sidecar 优先、Standard Image 兜底、PID 1 支持特定场景——在控制训练生命周期的同时不绑架用户环境。
    • 可追溯训练:Training SDK 输出 Metrics / Artifact / Model;Job → Artifact → Model 携带代码版本、镜像、超参、数据集与指标,每个模型都能回答“我是怎么训练出来的”。
    • 后训练评测:接入 MLflow 与指标对比;真机评测以录制视频 + VLM 判定 Success / Failure 建立第一版基线。
    • 结果:2 名算法研究员的真实 VLA 训练全部走平台路径,累计约 30–50 次训练任务,没有因运行时限制绕开平台;“训练 → 模型 → 端侧推理”链路跑通。
  • 横穿最近一年后半段、贯穿多个系统的能力演进,两条线均由我主导(与 CTO 共同探索):产品侧把系统能力暴露给用户已有的 AI,研发侧把 Git 从代码仓库变成研发工作台。

    • MCP + Skill 产品侧:拒绝在系统内重造 Chat UI,改为把采集与后训练系统核心能力 MCP 化——MCP 描述“系统能做什么”(创建项目、配置任务、分配供应商、认证登录、训练分析),Skill 描述“业务该怎么做”(必填字段、依赖关系、操作顺序、人工确认节点),登录也封装成工具,整条链路在 AI 对话内走完;首条业务链路约一周打通,运营真实使用约两周、每周 40–50 个项目,并基于反馈在 Skill 层加入人工确认节点。
    • Git 研发工作台:一手(Issue)→ AI 分析 / 施工 → PR → AI Review → 自动修改 → 人工 Checkpoint → Merge;我亲自搭建这套自动化基础设施(Issue 分析、PR 生成、Review 与修改闭环),并抽象进自己维护的开源工具;流程只保留“需求授权 / 澄清”与“最终验收”两个人工 Checkpoint,复杂度判断不交给 AI;设计与决策全程回写 Git,工程决策历史可追溯。
    • 扩展与落地:AI 角色从 Operator 扩展到 Analyst(训练任务状态、指标与质量分析);该模式成为软件团队默认工作方式,公司各团队向软件团队提需求统一走 Git 一手。
    • 证据边界:MCP 线因人力未继续大规模铺开;研发模式无量化效率数据,可观察的变化是研发关注点从重复执行逐渐转向业务语义、方案判断与最终验收。

Previous

蔚来汽车

技术专家 / 团队负责人 · AD 云端工程部

历任数据与计算相关技术负责人,带领约 15 人团队,负责智驾云端架构方案、数据基础设施、AI 计算平台及创新项目落地;既承担系统架构与关键技术设计,也负责跨团队项目推进和团队交付。历年绩效四五星、多次晋升。

代表项目

  • 把百万辆级量产车队的非行车时段闲置算力组织成可被云端管理、调度的边缘计算网络;负责车端独立运行模式及车云边缘计算的整体方案设计与落地,项目横跨整车、智能硬件、网络、云端、芯片、运营、法务等十余个团队。

    • 车辆独立运行模式:设计车辆在常规行车、充电、节能及独立运行等状态间的状态机与切换机制,支持通过 CAN 信号触发独立模式;协同完成供电、网络、功耗、芯片、交换机、水冷及热管理等系统分析,并设计底层启动 Agent,根据整车健康状态控制计算环境生命周期。
    • 车云边缘计算:选择 K3s 作为车端容器运行环境,设计云端控制器、车端 Agent 与 MQTT 通信体系,通过 TLS、心跳和状态同步管理动态车辆节点,使云端能够按车辆状态和资源配额完成任务下发、启动和回收。
    • 规模化调度:针对车辆网络不稳定、上下线频繁及不同车型硬件资源差异,设计车辆注册、可用资源池及实例数控制机制;将早期实时调度调整为 5–10 分钟批量调度,降低网络波动造成的频繁启停。
    • 业务闭环:结合车端存储重新规划数据生命周期,在车辆运行阶段识别并持久化关键数据,在非业务时段唤醒车辆完成处理、评测与结果上传;同步参与用户沟通、法务协议及业务模式设计。
    • 验证结果:完成百车级真实车辆测试,最高约 60 台同时在线;端到端请求时延约 120ms、首 Token 约 240ms,并与外部合作方完成真车算力验证;完成从成本模型到客户验证的完整商业闭环,结论为技术成立、商业经济性在当时条件下不足,为集团决策提供依据。
  • 智算中心计算服务|在线推理、离线计算与万卡集群

    已上线 2022.01 – 2022.10 / 2023.10 – 2024.02 / 2025.05 – 2025.10

    围绕集团 GPU 算力基础设施,先后负责在线大模型推理、智驾离线计算及大规模 GPU 集群资源治理。三段工作面向不同 workload 独立建设,覆盖从模型 Serving、计算优化到集群资源管理的完整计算基础设施。

    • 在线大模型推理
    • 面向 Nomi 等业务建设通用在线推理平台,基于 KServe + Kubernetes 建立模型部署、扩缩容、流量调度、高可用和监控体系,三个月完成首个生产版本上线。
    • 持续推动推理 Runtime 从 vLLM → LMDeploy → TensorRT-LLM 演进,并结合 KV Cache、Prompt Cache、模型量化等手段优化推理性能;作为生产用户推动 NVIDIA 完善 TensorRT-LLM 的业务适配。
    • 针对大模型请求特征设计专用负载均衡策略(按并发额度 / 槽位调度),并完成跨地域网络链路和故障切换设计,实现服务故障重启、单机故障迁移及集群级切换。
    • 优化后的 7B 模型首 Token 延迟达到约 30ms;平台后续扩展至 20+ 业务、数百张 GPU,并通过 HAMI vGPU 治理(1/8 粒度拆分 + 业务资源盘点)将推理 GPU 从 260+ 张降到 140+ 张。
    • 智驾离线计算
    • 面向智驾模型发版评测与数据生产场景(每批约 10 万条、每条约 5 分钟,投入几千张卡),重新梳理数据、网络与计算资源的部署关系,降低跨 IDC 数据传输对计算效率的影响。
    • 将完整计算过程按模型推理、后处理等阶段拆分,对可复用中间结果进行缓存,避免模型或后处理单独变更时重复执行整条流水线。
    • 根据不同计算阶段的 CPU/GPU 资源特征进行任务拆分,并通过 vGPU 细粒度资源配置提升单卡任务密度。
    • 最终同样 10 万条数据端到端耗时由约 8 小时降至约 4 小时,GPU 计算资源减少约一半,固定发版窗口下的计算吞吐提升约一倍。
    • 大规模 GPU 集群资源治理
    • 面向短时、高并发、小资源占用任务,与团队共同建设动态 vGPU 资源体系,将 GPU 从整卡资源拆分为细粒度动态配额,提高任务换入换出和资源复用效率。
    • 针对多个 Kubernetes 集群版本不一致、训练与推理资源池割裂的问题,独立设计并重构多集群统一管理架构,抽象统一的资源、任务与用户模型,将分散在各集群的管理能力收敛到统一控制层。
    • 通过统一资源池和任务调度机制降低多集群资源碎片,使不同业务能够跨资源池灵活调度;阶段内整体计算吞吐约翻倍。
  • 作为数据生产团队负责人(3–5 人),主导重构 PB 级智驾训练数据的管理与生产体系,将数据标准化、存储、处理、质检和交付纳入统一系统。体系覆盖约 2PB 数据,并成为后续多个数据及算法团队之间的数据流转基础。

    • 数据管理中心
    • 对传感器、日志、真值及生成数据建立统一数据模型,支持 H.264/H.265/MKV/JPEG、NPZ/PCD、PB/JSON/CSV 等不同数据形态的标准化组织与转换。
    • 将数据统一划分为时序和帧级粒度,为单位数据建立唯一 ID,并建立不同粒度间的转换关系;该 ID 后续成为多个团队间传递和识别训练数据的统一方式。
    • 基于内容 Hash 和离散文件存储重构底层数据组织方式,减少重复存储;主导架构、API、数据结构与用户 SDK 设计,使算法侧不再依赖具体文件路径与格式读取训练数据。
    • 数据管理中心最终成为训练数据进入后续生产体系的统一入口,为数据复用、追踪和审计提供基础。
    • 数据生产中心
    • 将原本依赖十余个人工环节串联的数据生产流程重构为自动流水线,覆盖需求 → 数据筛选 → 任务执行 → 标注 / 处理 → 质检 → 交付等环节。
    • 建设基于 Event Trigger 的任务驱动机制,统一长期运行服务与批量计算任务的调度接口;以标准数据集作为生产环节之间的交付载体,建立数据处理过程中的血缘关系。
    • 重构后单条数据从需求到训练就绪,由人工约 3 个月压缩至自动约 7 天,Data-to-Model 迭代效率显著提升。
    • 视频训练与存储优化
    • 面对千万级训练数据中高清 JPEG 占用百 PB 级存储的问题,与感知团队推动训练数据由图片向视频体系迁移;在缺乏成熟行业方案的情况下,约两周内完成数据改造并恢复训练。
    • 将问题拆分为数据格式统一与训练 Runtime 适配,最终选择统一数据格式路线;按 数据集 → 数据 → 传感器 → 文件 / 帧 建立分层数据结构,并增加分层缓存降低视频随机读取与解码对训练性能的影响。
    • 设计基于 MPI 的高性能数据处理框架,通过任务队列和多进程充分利用单机 CPU/GPU 资源,在有限计算资源下完成千万级历史数据转换。
    • 最终存储空间降低约 95%、数据加载效率提升约 110%、数据处理效率提升约 3 倍;两周内完成千万级数据处理,节省存储成本约 3000 万元。
    • 大模型训练数据交付
    • 面向大模型训练需求,复用既有 MPI 数据处理体系与视频解码能力,完成百万级无监督数据的视频、点云解码、重构与组织交付。
    • 针对海外开源数据获取成本高、跨境带宽受限的问题,基于 XRay 建设多节点数据传输链路,将海外数据经公网节点汇聚并回传内部网络。
    • 链路实际带宽达到约 5Gbps,海外节点成本约 25 元/月/台、回源流量约 0.25 元/GB,整体成本较跨境专线方案降低约 75%。

Earlier

早期经历 · 2015 — 2021

  • 快手 · 基础架构

    2020 — 2021

    资深研发工程师。打造公司级日志监控系统(10 亿条/分钟),基于十万服务、调用链深度达几十层的规模建设服务异常分析能力——监控大盘、服务拓扑、变更分析、故障诊断;立项并完成服务故障阻断项目,消灭 50% 部署间故障。

  • 金山云 · 视频云 CDN

    2017 — 2019

    高级研发工程师。负责 CDN 业务一体化监控(日均 5000 万条边缘数据),维护 OpenFalcon / Prometheus,建设报警平台与运维数据预测体系。

  • 现在支付 & 分贝通

    2015 — 2017

    初级工程师。创业型公司,主导核心业务系统——账户系统与票务系统的从零建设与持续迭代。