Lizj / AI Learning

INTERACTIVE STUDY MAP · 2026

从理解训练,
到亲手完成微调。

以中文《动手学深度学习(PyTorch版)》为主线。每章先讲清一个知识点,再用小例子和实验检验理解;最终为在 H100 上训练模型打基础。

CURRENT POSITION / 当前进度

第 2 章「预备知识」2.2「数据预处理」。

已确认:用户能区分训练与预测,并知道预测新样本时有输入和已学参数、没有正确标签。第 2 章的数据预处理示例已在本机验证修复,但用户尚未反馈运行结果。
下一步:让用户用 inputs.mean(numeric_only=True) 重跑 2.2 节示例,解释为何只填补数值列,随后继续原书的类别变量独热编码与张量转换。

查看本章目标
00/15 已完成章节 进度只在实际验证掌握后更新
THE ROADMAP

三段路,十五章。

展开章节即可看到要解决的问题、原书入口和完成标准。这里的学习目标是本次对话制定的安排,原书目录请以官方版本为准。

PART 01

训练的基本语言

弄清训练如何运转,写出第一个可解释的训练循环。

5 章
01 引言 机器学习解决的是什么问题;训练与预测分别发生在什么时候。 未完成

这一章要解决

  • 机器学习解决的是什么问题;训练与预测分别发生在什么时候。
  • 数据、输入、标签、模型、参数、损失函数、优化算法分别扮演什么角色。
  • 为什么训练集表现好不等于遇到新数据也好;认识泛化和数据分布。
完成标准

能用一个自己的例子讲清“数据 → 预测 → 衡量误差 → 更新参数 → 在新数据上检查”的闭环。

02 预备知识 用 PyTorch 张量表示标量、向量、矩阵和批量数据;看懂形状、轴、广播、索引。 未完成
小节 2.1–2.7。打开原书本章 ↗

这一章要解决

  • 用 PyTorch 张量表示标量、向量、矩阵和批量数据;看懂形状、轴、广播、索引。
  • 将原始数据变成能训练的数字,并识别缺失值及基本预处理问题。
  • 只补训练所需的线性代数、微积分和概率:矩阵乘法、导数与链式法则、随机变量与期望。
  • 理解自动微分记录什么,backward() 算什么,梯度存在哪里。
完成标准

能预测简单张量运算的形状,并用 PyTorch 验证一个手算梯度。

03 线性神经网络 线性回归如何从输入得到连续数值预测;参数、偏置和平方损失怎样连接。 未完成
小节 3.1–3.7。打开原书本章 ↗

这一章要解决

  • 线性回归如何从输入得到连续数值预测;参数、偏置和平方损失怎样连接。
  • 小批量随机梯度下降的完整训练循环:取数据、前向计算、损失、反向传播、更新、清梯度。
  • 分类任务为什么需要分数与概率;softmax、交叉熵和准确率各是什么。
  • 比较从零实现与 PyTorch 简洁实现,并在 Fashion-MNIST 上跑通分类。
完成标准

能独立解释并运行一个回归和一个分类训练循环,区分损失下降与模型真的泛化。

04 多层感知机 为什么堆叠线性层仍可能只是线性变换;非线性激活函数解决什么。 未完成
小节 4.1–4.10。打开原书本章 ↗

这一章要解决

  • 为什么堆叠线性层仍可能只是线性变换;非线性激活函数解决什么。
  • 隐藏层、前向传播、计算图和反向传播如何协作。
  • 训练误差、验证误差、欠拟合、过拟合、模型选择与分布偏移。
  • 权重衰减、Dropout、参数初始化和数值稳定性各针对什么失败现象。
完成标准

能训练一个小型 MLP,并从训练与验证曲线判断过拟合、欠拟合或优化问题。

05 深度学习计算 把网络组织成层和块;查看、初始化、共享和管理参数。 未完成
小节 5.1–5.6。打开原书本章 ↗

这一章要解决

  • 把网络组织成层和块;查看、初始化、共享和管理参数。
  • 自定义层与延后初始化解决哪些工程问题。
  • 保存与恢复模型及训练状态;CPU/GPU 设备放置和数据搬运。
  • 将最小实验迁移到 H100 前,检查设备、显存、数据类型与可复现性。
完成标准

能把一个模型移到 GPU,训练、保存、重新加载,并确认预测一致。

PART 02

主要网络结构

从图像和序列模型走到注意力机制与 Transformer。

5 章
06 卷积神经网络 图像的空间结构为什么适合局部连接和参数共享。 未完成
小节 6.1–6.6。打开原书本章 ↗

这一章要解决

  • 图像的空间结构为什么适合局部连接和参数共享。
  • 卷积核、填充、步幅、通道和汇聚如何改变特征图形状。
  • LeNet 如何把这些组件串成可训练的分类器。
完成标准

能算出一个卷积层的输出形状,并跑通一个小型图像分类模型。

07 现代卷积神经网络 AlexNet、VGG、NiN、GoogLeNet 分别做了什么结构改进。 未完成
小节 7.1–7.7。打开原书本章 ↗

这一章要解决

  • AlexNet、VGG、NiN、GoogLeNet 分别做了什么结构改进。
  • 批量规范化如何影响训练;残差连接为什么让深层网络更易优化。
  • DenseNet 与 ResNet 的连接方式有何区别;哪些思想可迁移到其他模型。
完成标准

能从结构图说明残差连接的作用,并识别深层网络训练中的梯度问题。

08 循环神经网络 序列数据为什么不能只当作无序样本;文本如何分词并组成训练样本。 未完成
小节 8.1–8.7。打开原书本章 ↗

这一章要解决

  • 序列数据为什么不能只当作无序样本;文本如何分词并组成训练样本。
  • 语言模型在预测什么;困惑度衡量什么。
  • 循环状态如何携带上下文;通过时间反向传播为何容易遇到长依赖问题。
完成标准

能构造一个字符级语言模型的数据批次,并解释 RNN 的输入、状态和输出。

09 现代循环神经网络 GRU、LSTM 的门控在控制什么;双向和深层 RNN 适用于什么场景。 未完成
小节 9.1–9.8。打开原书本章 ↗

这一章要解决

  • GRU、LSTM 的门控在控制什么;双向和深层 RNN 适用于什么场景。
  • 机器翻译中的编码器—解码器与 seq2seq 框架。
  • 解码时贪心搜索与束搜索如何权衡质量和计算量。
完成标准

能画出 seq2seq 的信息流,并说明固定长度上下文的局限。

10 注意力机制 查询、键、值与注意力权重分别是什么;评分函数和 softmax 如何得到权重。 未完成
小节 10.1–10.7。打开原书本章 ↗

这一章要解决

  • 查询、键、值与注意力权重分别是什么;评分函数和 softmax 如何得到权重。
  • Bahdanau 注意力如何让解码器选择相关的输入位置。
  • 多头注意力、自注意力与位置编码解决什么问题。
  • Transformer 如何组合注意力、前馈层、残差连接和规范化;区别编码器与解码器的信息可见范围。
完成标准

能手算一个极小的注意力例子,并解释生成模型为什么要遮住未来词元。

PART 03

优化、性能与应用

学会判断训练瓶颈,并完成预训练模型的微调。

5 章
11 优化算法 梯度下降、随机梯度下降、小批量训练各如何使用数据与计算资源。 未完成
小节 11.1–11.11。打开原书本章 ↗

这一章要解决

  • 梯度下降、随机梯度下降、小批量训练各如何使用数据与计算资源。
  • 学习率、动量、AdaGrad、RMSProp、Adam 和学习率调度器分别改变了更新的哪一部分。
  • 训练不收敛、震荡、过慢时如何定位学习率、梯度和数据问题。
完成标准

能读懂优化器配置,用损失曲线为一个训练问题选择排查方向。

12 计算性能 GPU 异步执行为何使计时容易出错;计算、内存与数据传输可能卡在哪里。 未完成
小节 12.1–12.7。打开原书本章 ↗

这一章要解决

  • GPU 异步执行为何使计时容易出错;计算、内存与数据传输可能卡在哪里。
  • 自动并行、多 GPU 数据并行与参数服务器的基本通信方式。
  • 单张 H100 实验中如何观察吞吐、显存峰值和 GPU 利用率;多卡内容按实际机器配置实践。
完成标准

能正确计时一段 GPU 训练代码,并说明当前瓶颈的证据。

13 计算机视觉 图像增广与迁移学习怎样改善小数据训练。 未完成
小节 13.1–13.14。打开原书本章 ↗

这一章要解决

  • 图像增广与迁移学习怎样改善小数据训练。
  • 分类、目标检测、语义分割的输出目标有何不同。
  • 边界框、锚框、SSD、R-CNN、全卷积网络和转置卷积各解决哪类任务。
  • 训练集、验证集和测试集在实战竞赛中的分工。
完成标准

能完整跑通一次预训练视觉模型微调,并按任务选择合适的输出与指标。

14 自然语言处理:预训练 词嵌入、word2vec、近似训练、GloVe 和子词表示怎样把文本转成可学习的表示。 未完成
小节 14.1–14.10。打开原书本章 ↗

这一章要解决

  • 词嵌入、word2vec、近似训练、GloVe 和子词表示怎样把文本转成可学习的表示。
  • 预训练目标是什么;预训练数据如何构造与评估。
  • BERT 的双向编码与预训练目标;预训练与下游微调如何衔接。
完成标准

能说明词向量和 BERT 表示的区别,并解释预训练任务的输入、目标和损失。

15 自然语言处理:应用 情感分析和自然语言推断的数据、标签与评估方式。 未完成
小节 15.1–15.7。打开原书本章 ↗

这一章要解决

  • 情感分析和自然语言推断的数据、标签与评估方式。
  • RNN、CNN、注意力模型在文本分类中的不同做法。
  • 如何将预训练 BERT 微调用于序列级和词元级任务;训练与验证怎样组织。
完成标准

能完成一次预训练模型微调,并用独立验证集说明效果与局限。

HOW WE LEARN

怎么学,怎么确认学会

01 / 先理解

一次讲一个知识点

先解释概念与术语,再给具体例子。不直接抛未经解释的公式。

02 / 再动手

用最小实验验证

先在小规模数据上观察现象,再逐步迁移到 H100。

03 / 最后判断

能解释失败原因

能说清原理、运行或改动代码,并判断一种常见训练问题,才算完成一章。