从 Latency/MFU 指标出发,深入 GPU 架构、CUDA 算子、分布式训练与推理系统。 按照「建立指标 → 发现瓶颈 → 实施优化 → 验证收益」的工程闭环,完成 8 个可运行综合项目。
不是零散介绍工具,而是按照工程流程,建立完整的性能优化能力
按「建立指标 → 发现瓶颈 → 实施优化 → 验证收益」流程学习,每一步都可量化、可验证。
从 GPU、CUDA、分布式通信原理出发,配合 PyTorch、Triton、NCCL 代码实验理解底层机制。
既讲分布式训练、FSDP 与通信优化,也讲 KV Cache、Batching、推测解码与 PD 分离。
训练性能分析、瓶颈定位、方案设计与优化验证能力,而非记忆 API。
每章独立可运行脚本;关键实验提供 CPU 模拟路径(内存访问模拟、Roofline 建模、调度器模拟),有 GPU 则深度跑真实 Profiler/算子。
循序渐进,从指标到优化,完整覆盖 AI 系统性能工程
每个项目都是阶段知识的实战总装,可独立完成、可写进简历
指标计算库 + 可视化看板,建立 AI 系统性能基线。
用 PyTorch Profiler 输出分析报告与优化清单。
Coalescing/Kernel 优化前后数据对比实验。
实现并优化融合算子(含 Flash Attention 思想)。
通信耗时拆解 + 拓扑对比实验。
显存曲线对比 + FSDP 训练实验。
可运行推理服务 + 吞吐对比。
压测报告 + 优化验证 + 技术报告。
← 熵减智算