28 章完整流程 · Python / PyTorch / CUDA / Triton / NCCL

AI Infra
性能工程实战

从 Latency/MFU 指标出发,深入 GPU 架构、CUDA 算子、分布式训练与推理系统。 按照「建立指标 → 发现瓶颈 → 实施优化 → 验证收益」的工程闭环,完成 8 个可运行综合项目。

28
章节
7
阶段
8
综合项目
2
方向(训练+推理)
核心特色

为什么选择这门课程

不是零散介绍工具,而是按照工程流程,建立完整的性能优化能力

🔄

指标到优化完整闭环

按「建立指标 → 发现瓶颈 → 实施优化 → 验证收益」流程学习,每一步都可量化、可验证。

🔬

原理与代码实操并重

从 GPU、CUDA、分布式通信原理出发,配合 PyTorch、Triton、NCCL 代码实验理解底层机制。

🧠

训练与推理双覆盖

既讲分布式训练、FSDP 与通信优化,也讲 KV Cache、Batching、推测解码与 PD 分离。

🎯

面向真实工程问题

训练性能分析、瓶颈定位、方案设计与优化验证能力,而非记忆 API。

💻

可运行 Demo + 无 GPU 可学

每章独立可运行脚本;关键实验提供 CPU 模拟路径(内存访问模拟、Roofline 建模、调度器模拟),有 GPU 则深度跑真实 Profiler/算子。

课程大纲

7 个阶段,28 章内容

循序渐进,从指标到优化,完整覆盖 AI 系统性能工程

0

性能工程方法论

Ch00-Ch03 · 4 章
岗位路线 优化闭环 Latency/Throughput/QPS MFU/Goodput/Roofline
1

GPU 硬件与系统

Ch04-Ch07 · 4 章
SM/SP/SIMT 显存层次 Tensor Core NVLink/RDMA
2

CUDA 与算子优化

Ch08-Ch12 · 5 章
线程模型 Coalescing Profiler/Nsight Kernel Fusion Triton
3

分布式训练

Ch13-Ch17 · 5 章
DP/TP/PP 集合通信 NCCL FSDP/ZeRO 通信瓶颈
4

Compiler 与 Runtime

Ch18-Ch20 · 3 章
Profiler 全链路 torch.compile CUDA Graph
5

大模型推理系统

Ch21-Ch26 · 6 章
Continuous Batching KV Cache Paged Attention 推测解码 PD 分离 MoE
6

综合实战

Ch27 · 1 章
端到端压测 瓶颈定位 优化验证 技术报告
八个综合项目

把知识点串成完整工程闭环

每个项目都是阶段知识的实战总装,可独立完成、可写进简历

PROJECT 01

性能基线与指标看板

指标计算库 + 可视化看板,建立 AI 系统性能基线。

PROJECT 02

Profiler 定位训练瓶颈

用 PyTorch Profiler 输出分析报告与优化清单。

PROJECT 03

CUDA 内存访问实验

Coalescing/Kernel 优化前后数据对比实验。

PROJECT 04

Triton 融合算子

实现并优化融合算子(含 Flash Attention 思想)。

PROJECT 05

分布式通信分析

通信耗时拆解 + 拓扑对比实验。

PROJECT 06

FSDP 显存优化

显存曲线对比 + FSDP 训练实验。

PROJECT 07

KV Cache + Batching 服务

可运行推理服务 + 吞吐对比。

PROJECT 08

端到端压测与优化

压测报告 + 优化验证 + 技术报告。

技术栈

使用的技术与工具

Python 3.10+ PyTorch 2.x torch.compile CUDA C/C++ Triton DSL NCCL torch.distributed FSDP Nsight Systems Nsight Compute nvidia-smi Roofline Model KV Cache Paged Attention Continuous Batching
← 熵减智算