从理论到实践,从基础到高级,完整掌握大语言模型的构建流程
不依赖 Transformers 库,所有核心算法从零实现。BPE Tokenizer、Self-Attention、Transformer Block 全部手写。
从单头 Attention → 多头 → Transformer Block → 完整 GPT。每一步都可运行、可验证、可理解。
包含分布式训练、LoRA 微调、RLHF 对齐、模型量化、推理部署等生产环境必备技术。
从 Tokenization 到部署的端到端实现。预训练、微调、对齐、优化,一个都不少。
每章独立脚本,可单独运行和测试。Ch01 架构导览、Ch09 Self-Attention、Ch17 GPT 架构、Ch28 预训练,关键章节都有完整实现。
循序渐进,从基础到高级,完整掌握 LLM 构建技术
← 熵减智算