NVIDIA AI Cluster Delivery Engineer

把 GPU 服务器、集群网络和系统软件交付成可验收的 AI 基础设施。

专注 GPU 集群部署、网络联调、系统交付、性能验收与运维移交。

主页访问量: 1589

1000+ GPU 服务器交付经验 真实累计交付GPU服务器数量
8 核心交付阶段 上架、布线、装机、联调、测试、验收
24h 现场问题响应 面向交付闭环的排障节奏
L0-L3 问题定位覆盖 硬件、系统、网络、集群软件

Selected Delivery Work

脱敏项目案例

可验证的交付场景。

01

某智算中心 GPU 集群交付

规模
数十台 GPU 服务器,IB / RoCE 高速网络
职责
负责系统部署、驱动安装、网络联调、NCCL 性能测试与验收文档。
结果
完成交付验收,沉淀部署记录、故障清单和运维移交材料。
02

AI 训练集群性能验收

规模
多节点多卡训练环境
职责
围绕 GPU、网络、存储、系统版本进行一致性检查与性能基线测试。
结果
定位性能波动原因,形成可复用的验收测试流程。
03

GPU 节点故障排查与恢复

规模
生产前交付现场
职责
处理 GPU 掉卡、驱动异常、链路不稳定、版本兼容等问题。
结果
缩短问题闭环时间,保障集群按计划进入验收阶段。

Capability Matrix

AI 集群交付能力矩阵

覆盖硬件、系统、网络、驱动、调度平台和验收测试,现场交付闭环。

Delivery Playbook

从设备进场到验收移交

稳定推进项目交付。

  1. 01 需求确认
  2. 02 硬件上架
  3. 03 网络布线
  4. 04 系统装机
  5. 05 驱动部署
  6. 06 集群联调
  7. 07 性能验收
  8. 08 文档移交

Technical Knowledge Base

技术文章

包含实战SOP、排障笔记及跑测规范。以下指导书均为在生产环境验证过的保姆级实操教程。

资料名称 内容类型 最近更新 作者
NVIDIA相关 5 条记录
烧写MLX ConnectX-7网卡固件 NVIDIA相关 2025/08/14 zhangjiannan
通过cuda-keyring配置cuda相关软件源 NVIDIA相关 2025/07/29 zhangjiannan
禁用nouveau模块 NVIDIA相关 2025/08/12 zhangjiannan
IB网卡OFED驱动安装 NVIDIA相关 2025/09/16 zhangjiannan
NVIDIA GPU Driver安装技术指导书 NVIDIA相关 2025/09/24 zhangjiannan
操作系统相关 5 条记录
ubuntu变更系统内核版本技术指导书--ubuntu2204 操作系统相关 2025/07/11 zhangjiannan
Hyper-V Linux虚拟环境搭建 操作系统相关 2025/10/17 zhangjiannan
Ubuntu生效rc.local启动脚本 操作系统相关 2025/10/23 zhangjiannan
永久关闭swap分区 操作系统相关 2025/10/28 zhangjiannan
pxe 批量安装操作系统 操作系统相关 2026/07/03 zhangjiannan
疑难案例及方案 1 条记录
Ubuntu离线安装软件及依赖技术指导书 疑难案例及方案 2025/08/15 zhangjiannan
测试相关 4 条记录
NVIDIA GPU FP16算力测试指导书 测试相关 2025/12/25 zhangjiannan
FP16测试和GPU Linpack测试的区别 测试相关 2025/12/12 zhangjiannan
openmpi 安装指导书 测试相关 2025/12/18 zhangjiannan
H100 cuda-samples 单机测试指导书 测试相关 2026/07/10 zhangjiannan
更多文章 >>>>> >>>>>

Contact

专注 NVIDIA AI 集群交付、智算中心建设与 GPU 基础设施。