技术专家 · 数据闭环 / AI Infrastructure / 复杂系统工程
边界还没定义清楚但必须往前走的问题,到了我手里能变成跑得起来的东西。
kinminghao@163.com
12 年软件与基础设施研发经验,长期围绕数据基础设施、AI 计算系统和数据闭环工作。 先后经历云计算 / 大数据、智能驾驶和具身智能三个阶段:在 NIO 负责过 PB 级训练数据体系、万卡 GPU 计算基础设施与百万车辆边缘计算项目; 近一年在补天石负责具身智能从设备接入、数据采集生产到训练 / 后训练的工程闭环。
工作角色横跨核心研发、系统架构与技术负责人——曾带领约 15 人团队,也长期保持一线系统设计和编码。 擅长接手边界模糊、跨团队、缺少成熟方案的工程问题,将其拆解为可运行、可扩展的生产系统; 主要工作边界集中在数据、计算、设备与 AI 工程基础设施,不以算法模型研发为主。
Capabilities
复杂系统落地
面对需求尚不清晰、边界尚未定义的场景,快速建立最小可运行系统,在真实业务反馈中逐步收敛架构。
系统判断与架构取舍
基于现实约束做明确取舍——倾向选择足够好且复杂度低的方案,而不是理论最优方案。
跨层系统设计
理解设备端真实约束,跨越软件和硬件的边界做合理的职责划分和系统设计。
从协议设计、格式演进、质量管理到大规模数据生产系统,覆盖数据全生命周期。
从边缘设备到云端 GPU 到分布式计算,根据工作负载特征选择和设计合适的计算架构。
工程交付与协同推进
以技术方案为锚点,推进硬件、软件、测试多团队各自的工作,协调联调和上线节奏。
没有成熟组织支撑时,不等人、不等流程、不等完美方案,直接动手把事情跑起来。
贯穿三组支撑能力
把 AI 系统化纳入产品和工程流程——不是"加一个 AI 功能",而是重新定义用户与系统的交互关系。
Recent Work
研发 Leader / 数据负责人
具身智能创业公司,业务覆盖机器人数据采集、训练与后训练基础设施。
代表项目
客户没有需求文档,只有一句“证明你们真的具备数据闭环能力”。项目要在一个月内把这句话变成可现场运行、可演示的系统——从方案定义到现场部署交付,由我单人完成。
面向 10 人以下具身研发团队,搭建可本地化部署的完整研发平台:覆盖设备接入、机器人对接、数据采集(遥操 / 录制 / 标注)、数据集与血缘、Pipeline、Training SDK、存储与 K3s 集群整条链路。我担任核心研发与整体技术方案负责人,除底层 Infra 与训练调度外的主体建设由我完成(4 人 / 3 个月 / 约 100 万投入),核心技术闭环完成度 90%+。
公司规模最大的生产系统。从“这个月要采到 100 小时”的 MVP 起步,长成平台、运营、供应商共用的生产管理体系,承载真实生产与结算,也是所有采集数据入库、进入下游的入口。我负责核心机制设计,接手 CTO 主导的重构初版(约两周从“演示可用”推到“生产可用”),并作为主要技术负责人持续演进。
自研双目设备到手时只能录视频、存内存卡,没有联网与上传能力。项目分两段:先把硬件接入生产系统,再借设备端编码瓶颈重构视频数据基础设施;我作为统一 Owner 负责协议、平台实现与跨端联调(4 人团队)。
为 VLA 训练建设面向异构算力的训练基础设施,让训练成为平台可理解、可追踪的对象,并延伸出后训练评测闭环(单人 PoC 起步,约 2–2.5 个月到工程化版本,工程化阶段 4 人团队推进)。
横穿最近一年后半段、贯穿多个系统的能力演进,两条线均由我主导(与 CTO 共同探索):产品侧把系统能力暴露给用户已有的 AI,研发侧把 Git 从代码仓库变成研发工作台。
Previous
技术专家 / 团队负责人 · AD 云端工程部
历任数据与计算相关技术负责人,带领约 15 人团队,负责智驾云端架构方案、数据基础设施、AI 计算平台及创新项目落地;既承担系统架构与关键技术设计,也负责跨团队项目推进和团队交付。历年绩效四五星、多次晋升。
代表项目
把百万辆级量产车队的非行车时段闲置算力组织成可被云端管理、调度的边缘计算网络;负责车端独立运行模式及车云边缘计算的整体方案设计与落地,项目横跨整车、智能硬件、网络、云端、芯片、运营、法务等十余个团队。
围绕集团 GPU 算力基础设施,先后负责在线大模型推理、智驾离线计算及大规模 GPU 集群资源治理。三段工作面向不同 workload 独立建设,覆盖从模型 Serving、计算优化到集群资源管理的完整计算基础设施。
作为数据生产团队负责人(3–5 人),主导重构 PB 级智驾训练数据的管理与生产体系,将数据标准化、存储、处理、质检和交付纳入统一系统。体系覆盖约 2PB 数据,并成为后续多个数据及算法团队之间的数据流转基础。
Earlier
资深研发工程师。打造公司级日志监控系统(10 亿条/分钟),基于十万服务、调用链深度达几十层的规模建设服务异常分析能力——监控大盘、服务拓扑、变更分析、故障诊断;立项并完成服务故障阻断项目,消灭 50% 部署间故障。
高级研发工程师。负责 CDN 业务一体化监控(日均 5000 万条边缘数据),维护 OpenFalcon / Prometheus,建设报警平台与运维数据预测体系。
初级工程师。创业型公司,主导核心业务系统——账户系统与票务系统的从零建设与持续迭代。