基础知识
本章介绍大模型学习所需的基础知识,包括数学、Python、神经网络和 NLP。
学习路线
| 主题 | 核心内容 | 预计时间 |
|---|---|---|
| 数学基础 | 线性代数、微积分、概率统计 | 1-2 周 |
| Python & ML | NumPy、PyTorch、Scikit-learn | 1-2 周 |
| 神经网络 | 前馈网络、反向传播、优化器 | 1 周 |
| NLP 基础 | 词嵌入、RNN、Seq2Seq | 1 周 |
如果你已有相关基础,可以直接跳到模型架构章节。
详细内容索引
math.md — 数学基础 (376 lines)
- 在大模型体系中的位置 (L10)
- 线性代数 (L28)
- 向量与矩阵运算 (L30)
- 特征值与特征向量 (L44)
- 矩阵的秩与 LoRA 的关系 (L62)
- 广播机制 (L74)
- 微积分 (L95)
- 导数与梯度 (L97)
- 链式法则 (L107)
- 雅可比矩阵 (L117)
- 梯度消失与梯度爆炸 (L131)
- 概率与信息论 (L145)
- 概率分布 (L147)
- 信息量与熵 (L159)
- 交叉熵 (L177)
- KL 散度 (L238)
- 最大似然估计 (L254)
- Softmax 函数 (L272)
- 数学定义与直觉 (L274)
- 数值稳定性问题 (L291)
- 苏格拉底时刻 (L355)
- 推荐资源 (L369)
neural-networks.md — 神经网络基础 (599 lines)
- 在大模型体系中的位置 (L11)
- 感知机到多层网络 (L33)
- 单个神经元 (L35)
- 多层感知机 (MLP) (L47)
- 万能逼近定理 (L94)
- 激活函数 (L102)
- ReLU 及其变体 (L104)
- Sigmoid 与 Tanh (L114)
- GELU (GPT 使用) (L122)
- SwiGLU (Llama 使用) (L130)
- 损失函数 (L142)
- MSE (均方误差) (L144)
- 交叉熵损失 (L152)
- 交叉熵的梯度推导 (L200)
- 反向传播 (L267)
- 计算图 (L269)
- 链式法则在计算图上的应用 (L273)
- PyTorch 的自动微分 (L350)
- 优化器 (L365)
- SGD 与动量 (L367)
- Adam 的数学推导 (L379)
- AdamW (解耦权重衰减) (L404)
- 学习率调度 (L414)
- 正则化 (L427)
- Dropout (L429)
- Layer Normalization (L441)
- Weight Decay (L461)
- 前沿优化器:Muon (L473)
- 核心思想 (L475)
- Newton-Schulz 迭代:高效计算 msign (L499)
- 简化版 Muon 实现 (L509)
- Muon vs AdamW 对比 (L550)
- 苏格拉底时刻 (L567)
- 常见问题 & 面试考点 (L579)
- 推荐资源 (L592)
nlp-basics.md — NLP 基础概念 (430 lines)
- 在大模型体系中的位置 (L11)
- 文本表示 (L31)
- One-Hot 编码的局限 (L33)
- 词嵌入的直觉 (L62)
- Word2Vec (L99)
- 分词基础 (L147)
- 字符级 vs 词级 vs 子词级 (L149)
- 分词的实现 (L159)
- 序列建模 (L234)
- RNN 的基本结构 (L236)
- 梯度消失问题 (L251)
- LSTM 的门控机制 (L261)
- GRU (L289)
- Seq2Seq 与注意力 (L305)
- Encoder-Decoder 架构 (L307)
- 注意力机制的起源 (Bahdanau Attention) (L330)
- 从 RNN+Attention 到 Transformer (L343)
- 语言模型 (L367)
- 统计语言模型 (N-gram) (L369)
- 神经语言模型 (L385)
- Perplexity 评估指标 (L395)
- 苏格拉底时刻 (L410)
- 推荐资源 (L422)
python-ml.md — Python & 机器学习 (558 lines)
- PyTorch 基础 (L10)
- 张量创建与基础操作 (L14)
- 广播机制(Broadcasting) (L57)
- 设备管理(CPU / GPU) (L78)
- Autograd 原理 (L106)
- 计算图与 .backward() (L110)
- 梯度累积与清零 (L129)
- detach 与 no_grad (L151)
- nn.Module 详解 (L173)
- __init__ 与 forward (L177)
- 参数管理 (L210)
- Hook 机制 (L235)
- 数据处理 (L263)
- 自定义 Dataset (L267)
- Collate Function 与动态 Padding (L297)
- DataLoader 的关键参数 (L340)
- Hugging Face 生态 (L350)
- transformers:AutoModel / AutoTokenizer / Trainer (L354)
- datasets:高效数据加载 (L407)
- accelerate:多卡训练封装 (L432)
- wandb 实验追踪 (L456)
- 常用调试工具 (L491)
- torch.profiler:性能瓶颈分析 (L493)
- 显存监控 (L515)
- 苏格拉底时刻 (L537)
- 推荐资源 (L546)
- 代码参考 (L555)
