40 章完整流程 · Python / PyTorch

从0手写
大语言模型

用 Python 和 PyTorch 从零实现 GPT-2 规模模型(124M 参数)。从 Tokenization 到 RLHF,不依赖 Transformers 库,全部手写。理解每一行代码,掌握 LLM 核心原理。

40
章节
124M
参数
10
模块
GPT-2
架构
核心特色

为什么选择这门课程

从理论到实践,从基础到高级,完整掌握大语言模型的构建流程

🔬

纯手写实现

不依赖 Transformers 库,所有核心算法从零实现。BPE Tokenizer、Self-Attention、Transformer Block 全部手写。

📈

渐进式架构

从单头 Attention → 多头 → Transformer Block → 完整 GPT。每一步都可运行、可验证、可理解。

工业级实践

包含分布式训练、LoRA 微调、RLHF 对齐、模型量化、推理部署等生产环境必备技术。

🎯

完整流程

从 Tokenization 到部署的端到端实现。预训练、微调、对齐、优化,一个都不少。

💻

可运行 Demo

每章独立脚本,可单独运行和测试。Ch01 架构导览、Ch09 Self-Attention、Ch17 GPT 架构、Ch28 预训练,关键章节都有完整实现。

课程大纲

10 个模块,40 章内容

循序渐进,从基础到高级,完整掌握 LLM 构建技术

这门课适合谁?

找到与你相似的学员

不同背景的学员,都能从这门课中获得价值

查看 README.md
了解完整用户画像
3 个典型学员
不同背景都能获益
学习路径
清晰的进阶路线
查看完整用户画像
01

破冰篇

Ch01-Ch02 · 2 章
LLM 概述 Transformer 革命 GPT vs BERT 架构导览
02

Tokenization

Ch03-Ch05 · 3 章
BPE 算法 词表构建 编码/解码 Tiktoken
03

Embedding 与位置编码

Ch06-Ch08 · 3 章
Token Embedding Position Encoding RoPE ALiBi
04

Attention 机制

Ch09-Ch12 · 4 章
Self-Attention Multi-Head Causal Mask Flash Attention
05

Transformer Block

Ch13-Ch16 · 4 章
Feed-Forward Layer Norm Residual 完整 Block
06

GPT 架构与推理

Ch17-Ch20 · 4 章
GPT-2 架构 自回归生成 KV Cache 加载预训练
07

训练基础设施

Ch21-Ch25 · 5 章
数据预处理 DataLoader AdamW 学习率调度
08

预训练

Ch26-Ch29 · 4 章
训练循环 分布式训练 从零预训练 Perplexity
09

微调与对齐

Ch30-Ch34 · 5 章
指令微调 LoRA RLHF PPO
10

高级主题与优化

Ch35-Ch40 · 6 章
模型量化 长文本 多模态 推理部署
技术栈

使用的技术与工具

Python 3.10+ PyTorch 2.0+ NumPy Matplotlib Transformer GPT-2 BPE Self-Attention LoRA RLHF Flash Attention KV Cache
← 熵减智算