Skip to content

LLM 101 · 中文大模型教程

把大模型
从原理学到能手写

从 Transformer 的一次矩阵乘法,到 RLHF 的一条梯度路径,再到 2026 年各家在注意力机制上的分歧。 一本按依赖顺序编排、每个结论都配可运行代码的在线教材。

86

教程正文

6.4万行

内容体量

994

可跑代码

26

渐进练习

这本教材和别的有什么不同

体系化,不是博客合集

六大模块按依赖顺序编排,每篇都标明「在大模型体系中的位置」。你随时知道自己在整张地图的哪里。

每个概念都能写出来

994 段可运行代码,从 Scaled Dot-Product Attention 到 GRPO,核心机制一律从零实现,不调库糊弄。

苏格拉底式追问

不直接给结论。每章末尾用问题逼你想清楚边界条件,配四级练习:选择题 → 填空 → 模块实现 → 完整实现。

读真正的源码

深入 vLLM、DeepSeek-V4、Kimi K2 的实现与论文,既看设计精妙处,也指出可疑之处。

六大模块

推荐学习路径

三条路线共用同一批内容,区别只在取哪些、按什么顺序取。

速通路线 · 约 2 周

适合有编程和深度学习基础、想快速建立 LLM 核心认知的人。跳过全部数学推导与训练细节。

完整路线 · 约 2 个月

按模块顺序学完全部内容,从零建立完整知识体系。练习系统贯穿全程,不是最后才做。

面试突击 · 3 天

只读每章的「常见问题 & 面试考点」和「苏格拉底时刻」两节,跳过正文推导。

项目理念

核心只有一句:不只是看懂,更要写得出来。

每个知识点都走同一条渐进路径 —— 概念理解 → 代码阅读 → 代码填空 → 独立实现。看懂一段代码和能默写出来,中间隔着的东西,正是面试和实际工作真正考察的。

本站内容开源在 GitHub,欢迎提 issue 指出错误。