Skip to content

基础知识

本章介绍大模型学习所需的基础知识,包括数学、Python、神经网络和 NLP。

学习路线

主题核心内容预计时间
数学基础线性代数、微积分、概率统计1-2 周
Python & MLNumPy、PyTorch、Scikit-learn1-2 周
神经网络前馈网络、反向传播、优化器1 周
NLP 基础词嵌入、RNN、Seq2Seq1 周

如果你已有相关基础,可以直接跳到模型架构章节。

详细内容索引

math.md — 数学基础 (376 lines)

  • 在大模型体系中的位置 (L10)
  • 线性代数 (L28)
    • 向量与矩阵运算 (L30)
    • 特征值与特征向量 (L44)
    • 矩阵的秩与 LoRA 的关系 (L62)
    • 广播机制 (L74)
  • 微积分 (L95)
    • 导数与梯度 (L97)
    • 链式法则 (L107)
    • 雅可比矩阵 (L117)
    • 梯度消失与梯度爆炸 (L131)
  • 概率与信息论 (L145)
    • 概率分布 (L147)
    • 信息量与熵 (L159)
    • 交叉熵 (L177)
    • KL 散度 (L238)
    • 最大似然估计 (L254)
  • Softmax 函数 (L272)
    • 数学定义与直觉 (L274)
    • 数值稳定性问题 (L291)
  • 苏格拉底时刻 (L355)
  • 推荐资源 (L369)

neural-networks.md — 神经网络基础 (599 lines)

  • 在大模型体系中的位置 (L11)
  • 感知机到多层网络 (L33)
    • 单个神经元 (L35)
    • 多层感知机 (MLP) (L47)
    • 万能逼近定理 (L94)
  • 激活函数 (L102)
    • ReLU 及其变体 (L104)
    • Sigmoid 与 Tanh (L114)
    • GELU (GPT 使用) (L122)
    • SwiGLU (Llama 使用) (L130)
  • 损失函数 (L142)
    • MSE (均方误差) (L144)
    • 交叉熵损失 (L152)
    • 交叉熵的梯度推导 (L200)
  • 反向传播 (L267)
    • 计算图 (L269)
    • 链式法则在计算图上的应用 (L273)
    • PyTorch 的自动微分 (L350)
  • 优化器 (L365)
    • SGD 与动量 (L367)
    • Adam 的数学推导 (L379)
    • AdamW (解耦权重衰减) (L404)
    • 学习率调度 (L414)
  • 正则化 (L427)
    • Dropout (L429)
    • Layer Normalization (L441)
    • Weight Decay (L461)
  • 前沿优化器:Muon (L473)
    • 核心思想 (L475)
    • Newton-Schulz 迭代:高效计算 msign (L499)
    • 简化版 Muon 实现 (L509)
    • Muon vs AdamW 对比 (L550)
  • 苏格拉底时刻 (L567)
  • 常见问题 & 面试考点 (L579)
  • 推荐资源 (L592)

nlp-basics.md — NLP 基础概念 (430 lines)

  • 在大模型体系中的位置 (L11)
  • 文本表示 (L31)
    • One-Hot 编码的局限 (L33)
    • 词嵌入的直觉 (L62)
    • Word2Vec (L99)
  • 分词基础 (L147)
    • 字符级 vs 词级 vs 子词级 (L149)
    • 分词的实现 (L159)
  • 序列建模 (L234)
    • RNN 的基本结构 (L236)
    • 梯度消失问题 (L251)
    • LSTM 的门控机制 (L261)
    • GRU (L289)
  • Seq2Seq 与注意力 (L305)
    • Encoder-Decoder 架构 (L307)
    • 注意力机制的起源 (Bahdanau Attention) (L330)
    • 从 RNN+Attention 到 Transformer (L343)
  • 语言模型 (L367)
    • 统计语言模型 (N-gram) (L369)
    • 神经语言模型 (L385)
    • Perplexity 评估指标 (L395)
  • 苏格拉底时刻 (L410)
  • 推荐资源 (L422)

python-ml.md — Python & 机器学习 (558 lines)

  • PyTorch 基础 (L10)
    • 张量创建与基础操作 (L14)
    • 广播机制(Broadcasting) (L57)
    • 设备管理(CPU / GPU) (L78)
  • Autograd 原理 (L106)
    • 计算图与 .backward() (L110)
    • 梯度累积与清零 (L129)
    • detach 与 no_grad (L151)
  • nn.Module 详解 (L173)
    • __init__ 与 forward (L177)
    • 参数管理 (L210)
    • Hook 机制 (L235)
  • 数据处理 (L263)
    • 自定义 Dataset (L267)
    • Collate Function 与动态 Padding (L297)
    • DataLoader 的关键参数 (L340)
  • Hugging Face 生态 (L350)
    • transformers:AutoModel / AutoTokenizer / Trainer (L354)
    • datasets:高效数据加载 (L407)
    • accelerate:多卡训练封装 (L432)
  • wandb 实验追踪 (L456)
  • 常用调试工具 (L491)
    • torch.profiler:性能瓶颈分析 (L493)
    • 显存监控 (L515)
  • 苏格拉底时刻 (L537)
  • 推荐资源 (L546)
    • 代码参考 (L555)