一次讲一个知识点
先解释概念与术语,再给具体例子。不直接抛未经解释的公式。
已确认:用户能区分训练与预测,并知道预测新样本时有输入和已学参数、没有正确标签。第 2 章的数据预处理示例已在本机验证修复,但用户尚未反馈运行结果。
下一步:让用户用 inputs.mean(numeric_only=True) 重跑 2.2 节示例,解释为何只填补数值列,随后继续原书的类别变量独热编码与张量转换。
展开章节即可看到要解决的问题、原书入口和完成标准。这里的学习目标是本次对话制定的安排,原书目录请以官方版本为准。
弄清训练如何运转,写出第一个可解释的训练循环。
能用一个自己的例子讲清“数据 → 预测 → 衡量误差 → 更新参数 → 在新数据上检查”的闭环。
backward() 算什么,梯度存在哪里。能预测简单张量运算的形状,并用 PyTorch 验证一个手算梯度。
能独立解释并运行一个回归和一个分类训练循环,区分损失下降与模型真的泛化。
能训练一个小型 MLP,并从训练与验证曲线判断过拟合、欠拟合或优化问题。
能把一个模型移到 GPU,训练、保存、重新加载,并确认预测一致。
从图像和序列模型走到注意力机制与 Transformer。
能算出一个卷积层的输出形状,并跑通一个小型图像分类模型。
能从结构图说明残差连接的作用,并识别深层网络训练中的梯度问题。
能构造一个字符级语言模型的数据批次,并解释 RNN 的输入、状态和输出。
能画出 seq2seq 的信息流,并说明固定长度上下文的局限。
能手算一个极小的注意力例子,并解释生成模型为什么要遮住未来词元。
学会判断训练瓶颈,并完成预训练模型的微调。
能读懂优化器配置,用损失曲线为一个训练问题选择排查方向。
能正确计时一段 GPU 训练代码,并说明当前瓶颈的证据。
能完整跑通一次预训练视觉模型微调,并按任务选择合适的输出与指标。
能说明词向量和 BERT 表示的区别,并解释预训练任务的输入、目标和损失。
能完成一次预训练模型微调,并用独立验证集说明效果与局限。
先解释概念与术语,再给具体例子。不直接抛未经解释的公式。
先在小规模数据上观察现象,再逐步迁移到 H100。
能说清原理、运行或改动代码,并判断一种常见训练问题,才算完成一章。