学习路径与主线导读

深度学习课程的全景地图:为什么这样分卷、主线怎么走、想速成该读哪几篇。

欢迎来到《从零开始学深度学习》。在正式开讲之前,我想先给你画一张地图,让你知道这门课打算把你带到哪里去,路上会经过哪些地方,以及万一你时间有限,有没有抄近路的办法。(这篇导读全是ai写的)

1.这门课的一条主线

很多人学深度学学得云里雾里,根本原因是主线不清。今天看个 CNN,明天啃个 Transformer,后天又跳到扩散模型,知识点像撒豆子一样东一颗西一颗,串不起来。

这门课的设计,从头到尾就咬住一条主线,我用一句话概括:

数据 → 模型 → 损失 → 优化 → 评估 → 部署。

无论你面对的是预测房价、识别图片,还是生成图片、训练大模型,拆开来看都是这六个环节在循环。我先把每一环讲透,再把它们组装成各种各样的模型——你后面看到任何新架构,都能往这条主线里套,不会慌。

具体来说,整门课分成了九卷,外加一个附录卷。下面我挨个说清楚每卷在主线里扮演什么角色。

2.九卷分别讲什么

第一卷·数学基础(1.1–1.7)。这是地基。深度学习说白了就是"用矩阵算账、用梯度调参",所以线性代数、概率论、微积分与凸优化这三样你绕不开。我会带推导、带直觉,不是塞一堆公式给你背。其中 1.3 节的 SVD 和 1.5 节的梯度下降,是后面反复要用的工具,务必吃透。最后一节 1.7 补算法复杂度与大 O 记号——后面从第7卷的架构分析到第9卷的工程落地,三句话离不开 O(n2)O(n^2)O(n)O(n),这块地基同样要提前打好。

第二卷·机器学习(2.1–2.15)。在碰神经网络之前,先用线性模型把"机器学习到底在干什么"这件事彻底搞明白。从最朴素的线性回归(2.1、2.2),到分类用的逻辑回归(2.3),再到把两者统一起来的广义线性模型 GLM(2.4)——这一节是我特意加的,讲完你会发现逻辑回归、泊松回归、Softmax 都是同一家族的不同成员,豁然开朗。接着是 PCA/SVM 这些经典算法,它们背后的数学(对偶、KKT、特征值)是大模型时代仍在用的底层零件。

第三卷·深度学习架构(3.1–3.12)。真正进入神经网络。先从多层感知机和反向传播(3.1,这篇我把链式法则从头推到尾)入门,再到 CNN、RNN/LSTM、注意力机制,最后到 Transformer。这一卷是整门课的重心,理解了它,你就理解了所有现代深度学习模型的地基。3.11 的 Mamba 是一座桥,连向后面的前沿架构卷。

第四卷·计算机视觉(4.1–4.10)。把第三卷的架构搬到图像上:从经典 CNN、目标检测(R-CNN/YOLO/DETR)、分割,到自监督学习(MAE)和视觉语言模型(CLIP)。

第五卷·自然语言处理(5.1–5.10)。从词嵌入、预训练,一路讲到 Scaling Law、RLHF 对齐、LoRA 微调、RAG 检索增强。这一卷的终点就是今天的大语言模型。

第六卷·生成式模型(6.1–6.5)。VAE、GAN、扩散模型(DDPM→Stable Diffusion→DiT)。这一卷数学最硬核,VAE 的 ELBO、GAN 的最优判别器、DDPM 的变分界,我都会把推导走完,不让你只看到答案却不知道怎么来的。

第七卷·前沿架构与高效序列建模(7.1–7.5)。2024–2026 年架构演进的前沿:连续时间网络 LNN、以 Mamba-2/Gated DeltaNet/RWKV 为代表的现代线性注意力与高效循环、长上下文稀疏注意力、旋转位置编码 RoPE 与长度外推,最后给一份架构选型指南。这里讲清楚一个重要事实——2026 年真实的生产级大模型,主流是"循环为主 + 少量注意力"的混合架构,而不是纯 Transformer。

第八卷·国产开源大模型剖析(8.1–8.6)。DeepSeek(V3→V4,含 R1 的 GRPO 强化学习)、Kimi(K1.5→K3,含 2026 年 7 月最新发布的 K3)、Qwen、GLM、MiniMax。每一篇都拆解它们各自的架构创新,让你看得懂这些模型"新在哪里"。

第九卷·工程落地与评测(9.1–9.6)。模型训完了,怎么部署、怎么量化、怎么搭 Agent、怎么评测、怎么防越狱——这些是真正把模型用起来的工程本领。

附录卷·算法与离散(A.1–A.7)。离散数学、数据结构、搜索算法、遗传/模拟退火/粒子群。这些和深度学习主线关系没那么紧密,但偶尔会用到(比如图搜索、优化算法的直觉),所以收在最后,按需查阅,不阻塞主线。

3.两条速成路径

如果你时间充裕,从 1.1 一路读到 9.6 当然最好。但现实里多数人没这个时间,所以我准备了两条速成路径,看你需求挑一条。

路径一:只想看懂大语言模型

如果你根本不碰计算机视觉,目的就是搞明白 ChatGPT、DeepSeek 这些大模型到底是怎么回事,建议这样走:

  1. 1.2 线性代数上 + 1.3 线性代数下(矩阵运算、SVD,挑着看)
  2. 1.4 概率统计(重点看交叉熵和 KL 散度)
  3. 2.1 线性神经网络 + 2.3 逻辑回归(理解线性模型和 Softmax)
  4. 3.1 多层感知机(吃透反向传播)
  5. 3.7 注意力机制 + 3.8 Transformer(这是大模型的核心架构)
  6. 第五卷全部(预训练、Scaling Law、RLHF、LoRA、RAG)
  7. 第七卷 7.2 现代线性注意力 + 7.4 RoPE 与长度外推(看懂 Mamba 这一类新架构,以及大模型怎么把上下文从 4k 撑到 32k)
  8. 第八卷全部(看懂 DeepSeek、Kimi 的具体创新)
  9. 第九卷挑感兴趣的(部署、Agent、评测)

这条路径大约 20 篇出头,能让你在不算长的时间里建立起对大模型的完整认知。

路径二:想要完整的深度学习基础

如果你目标是面试、转岗、做研究,需要扎扎实实的基础,那就老老实实走主线:

  1. 第一卷全部(数学地基,含完整推导)
  2. 第二卷 2.1–2.4 + 2.6 PCA + 2.12 SVM(核心算法,PCA 和 SVM 的推导是面试常考点)
  3. 第三卷全部(这是重心)
  4. 然后按你的方向,从第四、五、六卷里挑一条深入(视觉 / 语言 / 生成)

这条路径约 35 篇,是工程岗位和研究入门的最低配置。

4.怎么读效果最好

最后给你三条学习建议。

第一,推导要手推,别只看。 这门课凡是关键公式我都给了完整推导,但你看十遍不如自己拿笔推一遍。尤其是反向传播、SVD、ELBO 这几处,亲手推过一次,理解层次完全不同。

第二,每章末尾的练习题要做。 每章我都配了 3–4 个一问一答的小练习,帮你检验是否真的懂了;复杂的章节还附了大厂面试题。看完一节别急着往下走,先把练习做了。

第三,主线丢失时就回来看这篇。 学到中间容易钻进某个细节出不来,定期回来对照一下那张主线图(数据→模型→损失→优化→评估→部署),确认自己当前站在主线的哪一环,就不会迷路。

准备好了,就从 1.1 开始吧。

相关标签
深度学习学习路径导读