AI 学习路线:从入行到方向选择的完整地图
把"数学→计算机→数据→AI 基础理论→经典模型→神经网络→深度学习架构→主流方向"八层知识串成一条线,附必读论文清单。一篇文章回答"我要按什么顺序学 AI"。
这是一篇路线图,不是单点教程。适合刚准备入行/转岗 AI 的工程师, 也适合已经做了一段时间但"基础不牢"想回头补的同学。原文来自抖音 @你没活干吗 的两期视频(上:入行路线 / 下:基础之后的方向), 我把内容精修、纠错、扩成了这张完整地图。
一句话总结
AI 学习就是打地基再盖楼。地基四层是数学 / 计算机 / 数据 / AI 基础理论, 楼体是经典 ML → 神经网络 → 深度学习架构 → 主流方向。跳着学一定会崩,但每层只学"够用就行", 不要变成数学系毕业生才算入门。
为什么数学是第一道坎
提到 AI,大家第一反应就是高薪、前沿。但如果你想在这个领域里走得远,最绕不开的就是数学。 在 AI 里学数学的目的不是做题,而是看懂模型的设计逻辑。 所以每一个数学知识点,都要回答一个问题:它在 AI 里到底负责什么?
下面这张图是 AI 学习的完整知识地图(按从底到顶的依赖关系组织):
flowchart TD
M[数学基础<br/>线性代数/微积分/概率统计/最优化/信息论/数值分析]
CS[计算机基础<br/>编程/数据结构/Linux/Git/GPU]
D[数据基础<br/>类型/清洗/标注/分布]
T[AI 基础理论<br/>学习方式/模型评估/训练优化/表示学习]
CM[经典 ML 模型<br/>线性回归/逻辑回归/树/SVM/PCA/HMM]
NN[神经网络基础<br/>神经元/MLP/反向传播/激活函数/自动求导]
DL[深度学习架构<br/>CNN/RNN/Attention/Transformer/GAN/Diffusion]
DR[主流方向<br/>NLP/CV/具身智能]
M --> T
CS --> NN
D --> T
T --> CM --> NN --> DL --> DR① 数学基础(七门学科到底学什么)
1.1 线性代数
AI 里的一张图、一句话最后都会变成数字。这些数字通常不是一个单个的数,而是一个向量或矩阵。 神经网络每一层都在做矩阵运算——把向量旋转、拉伸、投影,直到初始向量和想要的向量重合,就算得到了结果。
学习重点:数形结合,不要死算行列式。要理解:
• 矩阵 = 空间变换
• 向量 = 空间里的点或方向
• 神经网络层 = 多次线性变换 + 一次非线性
1.2 微积分
AI 训练的核心是:先算模型预测错了多少(损失),再算一个可量化的值(梯度),然后根据值的大小调整参数。 深度学习训练靠的就是微积分,尤其是反向传播。
神经网络之所以能学习,是因为我们能计算损失函数对每一个参数的导数。 学习重点不是求导公式,而是理解:导数 = 神经网络里的变化率,梯度 = 损失下降最快的方向。
1.3 概率论与统计学
概率论研究不确定性。AI 面对的数据通常不是绝对确定的(这张图 90% 是猫、10% 是狗——AI 本质上就是给出一个可能性)。
进阶要学随机过程(不是单纯的概率论):处理连续变化的随机现象(机器人一步步在环境里干什么、股票价格变化)。 重点理解 Markov 链 和 高斯过程——后期在扩散模型加噪去噪、强化学习环境建模都会用到。
统计学则是反向工程:从有限数据里反推规律。训练前检查数据是否可靠、训练后检查模型是否过拟合——这些都属于统计学范畴。 数据分布漂移(distribution shift)也是统计学的活。
1.4 最优化理论
最优化理论就是"怎么让一个目标尽可能好"。AI 训练的目标是让损失函数尽可能小、模型效果尽可能好——所以训练模型本质就是优化问题。
真实深度学习大部分都是非凸优化,损失函数不是简单的碗状。如果你没学过最优化,遇到"模型不收敛、效果差"会少一个思考角度。
1.5 信息论
AI 任务本质上是处理信息。LLM 里的 next token prediction 就是信息论的应用。 不用深入推香农定理,只要理解交叉熵、KL 散度这些概念就够了。
1.6 数值分析
AI 模型在计算机上跑,计算机只能做到有限精度的计算——就会出现梯度爆炸、梯度消失这些问题。 深度学习本质上是大规模数值计算,做 inference 或大模型系统的同学需要深入学一下。
数学到底学到多深?目标是能看懂论文里的公式、能复现模型设计逻辑。别去做考研 1000 题, 那不是 AI 数学。做 LLM 推理优化的同学可以多花时间在数值分析上;做应用层的同学概率论+线代够用。
② 计算机基础(三天五天学完)
AI 最终要变成代码和系统运行。计算机基础是"够用即可"的一层,不应该耗太多时间。
• 编程基础:现在 AI 工具能帮忙写代码,但要能看懂它在干什么。基础语法、逻辑知道就好。
• 数据结构:理解数据在计算机里怎么组织(数组/链表/树/图/哈希)。
• Linux + Git:操作系统和版本管理工具。知道怎么回事、能在项目里拉 GitHub 代码就行。
• GPU / TPU:加速矩阵计算的硬件。去了解一下市面上型号(4090、A100、A800、H100),知道哪些适合训练、哪些适合推理。
学习节奏:整个计算机基础三天五天一周大概就能学完。卡太久说明方向错了——这些不是 AI 学习的核心,是工具熟练度。
③ 数据基础(数据比模型更重要)
数据质量经常比模型结构更重要。同一个模型,用好数据和坏数据的训练效果可能完全不一样。 数据工程的 4 个子模块:
• 数据类型:表格、文本、图像、音频、视频、时序。不同数据类型对应不同模型(图像用 CNN/ViT,文本用 Transformer)。
• 数据清洗:去重、去噪、修正异常值、统一格式。数据越脏,模型越容易学到错误规律。
• 数据标注:监督学习依赖标注。有的公司招"AI 数据运营"岗其实就是干标注。
• 数据分布:模型上线后经常遇到分布漂移(distribution shift)——把统计学学好的话这块根本没问题。
④ 怎么读论文
AI 发展非常快,最新知识都出现在论文或技术报告里。论文语言密度高、有些论文包装性强实际贡献有限。 看论文只要看清三件事:问题 / 方法 / 实验。
熟练后的阅读流程:
1. 先看 abstract:这篇论文干了什么、贡献在哪
2. 看 实验部分:效果怎么样、是不是真的比 baseline 强
3. 看 方法部分:怎么做到的、关键模块是什么
4. 判断哪些模块真正有贡献(是作者提出的还是套用别人的)
⑤ AI 基础理论
5.1 学习方式(5 种)
不同的学习方式数据和模型都不一样。但不要把学习方式和模型架构搞混——同一种 Transformer 可以用不同的学习方式。
# 5 种学习方式对照表
paradigms = {
"监督学习": "给输入+标准答案,学习映射关系",
"半监督学习": "少量标签 + 大量无标签数据一起训练",
"无监督学习": "没有标准答案,模型自己探索数据规律",
"自监督学习": "数据本身构造训练目标(如GPT用前文预测下一词)",
"强化学习": "通过奖励/试错学习行动策略(机器人、Agent)",
}
# 典型例子
examples = {
"监督学习": "图像分类、房价预测",
"半监督学习": "医疗影像(标注贵)",
"无监督学习": "聚类、降维",
"自监督学习": "GPT/BERT 预训练",
"强化学习": "AlphaGo、RLHF",
}5.2 模型评估
一个模型真正有价值的,是遇到新数据它仍然能表现得不错(泛化能力)。 AI 最终要用于真实世界,所以不能只看训练 loss,还要看鲁棒性和不确定性。
评估涉及的维度:指标设计、交叉验证、数据泄漏检测、鲁棒性测试、Benchmark 选型。
详见 LLM-08 模型评估。
5.3 训练优化
现在的 AI 能力不是写死的,是在训练过程当中学出来的。难点不是机械性降 loss,而是理解损失函数和优化器的关系。
# 训练四大件
loop = {
"损失函数": "loss = model.error(prediction, target) # 衡量模型错得多严重",
"优化器": "optimizer = Adam/SGD # 决定怎么调整参数",
"梯度下降": "param = param - lr * gradient # 沿损失下降方向更新",
"正则化": "loss = loss + lambda * L2(weights) # 防止过度记住训练集",
}
# 学习率(最敏感的超参)
learning_rate_guide = {
"太大": "loss 震荡、不收敛",
"太小": "loss 下降极慢、卡在局部最优",
"判断方法": "看训练曲线 + 用 Learning Rate Finder",
}5.4 表示学习
表示学习是从传统 ML 走向深度学习的关键。传统 ML 依赖人工特征,深度学习强调模型自动学习表示。 表示空间里可以做相似度、做分类、迁移到下游任务。
• 特征表示:把原始数据变成模型可用的信息
• Embedding:语义相似的词在向量空间里也接近(猫和狗的向量比猫和汽车更接近)
• 对比学习:拉近相似样本、推远不相似样本(CLIP、SimCLR)
• 迁移学习:一个任务学到的能力迁移到另一个任务
⑥ 经典机器学习模型
传统 ML 模型是很多深度学习思想的前身,论文和项目里经常作为 baseline。 理解每一类模型的问题、为什么被替代、哪些思想保留——这才是学习经典模型的意义。
# 经典 ML 模型对照
classic_ml = {
"线性回归": "用直线/线性公式预测连续值",
"逻辑回归": "用 sigmoid 把线性输出变成 0-1 概率(二分类)",
"决策树": "if-then 切分特征,直观易解释,但容易过拟合",
"随机森林": "很多棵树一起投票(集成学习思想)",
"SVM": "找使间隔最大化的分类超平面(理解分类边界)",
"PCA": "找到数据主要变化方向,用更少维度保留更多信息(降维/去噪)",
"HMM 隐马尔可夫": "序列建模的鼻祖,NLP 早期重要基础",
}几个关键纠错点(容易混淆):
• 逻辑回归虽然名字带"回归",但主要做分类
• 决策树通过不断切分特征把数据分类,单棵树容易过拟合 → 随机森林集成解决
• SVM的核心是"找到使间隔最大的分界线"(不是离样本越远越好)
• PCA是降维,本质是线性代数里的特征值分解,和信息论有天然联系
⑦ 神经网络基础
上面这些本质上都是神经网络的拓展。了解它的基本构成,是后续深度学习架构的基础。
7.1 神经元与 MLP
神经网络最小计算单元是神经元;神经元多了就是MLP(多层感知机)。 数据从输入层一层层经过模型得到预测结果,这个过程叫前向传播。
7.2 反向传播
模型先算出预测错误,再从输出层往前一层层计算每个参数应该怎么改。必须理解并手推一次反向传播——这是训练所有神经网络的基础。
7.3 激活函数
为了给网络引入非线性,引入了激活函数(ReLU、Sigmoid、Tanh、GeLU)。 没有激活函数,无论多少层神经网络都等价于单层线性变换。
7.4 自动求导
现代深度学习框架能训练复杂模型,靠的就是自动求导。 写好前向计算,框架自动搭计算图反向算梯度——比如 PyTorch 的 loss.backward() 就是自动计算参数梯度。
import torch
import torch.nn as nn
# 1. 最简单 MLP
model = nn.Sequential(
nn.Linear(784, 256), # 输入层 → 隐藏层1
nn.ReLU(), # 激活函数
nn.Linear(256, 128), # 隐藏层1 → 隐藏层2
nn.ReLU(),
nn.Linear(128, 10), # 隐藏层2 → 输出层
)
# 2. 前向传播
x = torch.randn(32, 784) # batch_size=32
logits = model(x) # → (32, 10)
# 3. 损失 + 反向传播(自动求导)
loss = nn.CrossEntropyLoss()(logits, torch.randint(0, 10, (32,)))
loss.backward() # ← 这里就是自动求导,框架算所有参数的梯度
# 4. 优化器更新参数
optimizer = torch.optim.Adam(model.parameters(), lr=1e-3)
optimizer.step()
optimizer.zero_grad()⑧ 深度学习经典架构
不同数据结构对应不同架构。下面按"解决什么问题 → 为什么被替代 → 留下什么思想"的逻辑展开。
8.1 CNN(计算机视觉)
CNN 是 CV 的基础。核心思想:局部感受野 + 参数共享,让模型天然适合处理图像。
cnn_history = {
"LeNet-5 (1998)": "最早的 CNN 雏形,手写数字识别",
"AlexNet (2012)": "ImageNet 比赛冠军,深度 CNN 成为 CV 主流",
"VGG (2014)": "全用 3×3 卷积堆叠,结构规整",
"ResNet (2015)": "残差连接让深层网络可训练,'学习变化量'而非'整个映射'",
"ViT (2020)": "把 Transformer 引入视觉,图像切 patch 当 token",
"SAM (2023)": "Segment Anything,视觉基础模型做通用分割",
}8.2 RNN(序列建模)
RNN 是序列建模的历史基础。理解 RNN 训练为什么容易梯度消失,才能理解后来为什么需要 LSTM 和 Transformer。
LSTM是 RNN 的改进版:通过门控机制控制信息保留和遗忘,解决了 RNN 记不住长距离信息的问题。
8.3 Attention 注意力机制(现代 AI 核心)
Attention 是现代 AI 核心思想之一。模型处在一个位置时,可以主动去关注其他重要的位置。 翻译一句话生成当前词时,不一定只看前一个词,而是看整句话里最相关的几个词。
必须理解:Attention 里的 Q / K / V 到底是什么;为什么 Attention 能做到长距离依赖。
# 注意力机制的简化版(理解 Q/K/V)
import numpy as np
def attention(Q, K, V):
# Q: Query (n, d_k) - 当前 token 在"问"什么
# K: Key (m, d_k) - 每个 token 在"声明"自己是什么
# V: Value (m, d_v) - 每个 token 实际携带的信息
# 1. Q · K^T: 计算每个 query 和每个 key 的相关度
scores = np.dot(Q, K.T) # (n, m)
# 2. 缩放(防止点积过大)+ softmax: 转成概率分布
d_k = K.shape[-1]
weights = np.exp(scores / np.sqrt(d_k))
weights = weights / weights.sum(axis=-1, keepdims=True) # (n, m)
# 3. 用权重对 V 加权求和: 取出最相关的信息
output = np.dot(weights, V) # (n, d_v)
return output, weights
# 类比:查字典
# Q = "我要查的问题"
# K = "字典里每个词的索引"
# V = "字典里每个词的内容"
# attention = "根据问题,从字典里挑出最相关的几个词的内容"8.4 Transformer(AI 爆发的起点)
AI 爆发就是从 Transformer 提出开始的——GPT / Claude / Gemini / LLaMA 等所有大模型都是基于 Transformer。 以 Attention 为核心,可以并行处理一整段输入,用 self-attention 衡量各位置关系。
Transformer 是现代 AI 的基石,必须熟练、必须学会。
8.5 GAN 与扩散模型(生成模型)
GAN(生成对抗网络):由生成器和判别器对抗训练。生成器生成的样本越来越真。 现在图像生成主流更多是扩散模型,但 GAN 的对抗思想仍是理解生成模型的重要基础。
扩散模型(Diffusion Model):训练时一步加噪,生成时一步去噪。 现在的图像/视频生成(Stable Diffusion、Sora、Midjourney)全用扩散模型。
# 扩散模型直观理解
diffusion_process = {
"前向(加噪)": "真实图 → 加噪 → 全部噪点 [训练时使用]",
"反向(去噪)": "纯噪点 → 逐步去噪 → 真实图 [生成时使用]",
"核心思想": "如果模型能学会'去噪一步',那它就能从纯噪点开始一步步去噪生成图",
}8.6 自编码器(表示学习)
自编码器是理解表示学习 / 压缩去噪 / 生成模型的基础。 模型学一个"压缩到隐空间 → 再重建出来"的过程,核心是学到有用的表示。
⑨ 主流研究方向与必读论文
学完前面八层,开始划分方向。不用每个方向都学,简要介绍 3 个主流:
9.1 NLP(自然语言处理)
让机器理解和生成人类语言。通过大规模预训练获得通用语言能力,再通过指令微调变成可对话、可推理的工具。
子方向:预训练模型、大模型架构、微调对齐、Agent、代码大模型等。
# NLP 必读论文(按发表顺序)
nlp_papers = [
("Transformer", "2017", "把注意力机制变成主流架构"),
("BERT", "2018", "双向预训练语言理解"),
("GPT-2/3", "2019-20", "开放技术的大语言模型"),
("InstructGPT", "2022", "RLHF 三阶段对齐的代表作"),
("LLaMA", "2023", "开源大模型(Meta)"),
("RAG", "2020", "把参数知识和外部检索结合"),
]9.2 CV(计算机视觉)
让机器看懂图像和视频。从早期 CNN 提取边缘纹理 → ResNet 解决深层训练 → ViT 把图像切成 patch → SAM 等视觉基础模型做通用分割。
9.3 具身智能(Embodied AI)
让机器在真实环境里执行动作。和大模型最重要的区别是:大模型处理语言和知识,具身智能处理物理环境和动作执行。
需要补充控制理论和传感系统知识。目前 RT-2 是 VLA(视觉-语言-动作)模型的一个代表——把视觉-语言指令和机器人控制结合,把动作表示成类 Token 形式。
方向选择建议:看你的专业背景 + 应用场景。做电商选 LLM/RAG/Agent;做图像选 CV/多模态;做硬件选具身智能/边缘部署。基础相通——前面八层打扎实,转方向成本很低。
附:自检清单
回头对照这个清单自查:
# AI 学习自检清单
## 数学
- [ ] 能解释矩阵是空间变换、向量是空间里的点/方向
- [ ] 能用一句话解释反向传播为什么能让神经网络学习
- [ ] 知道 KL 散度、交叉熵在 LLM 里起什么作用
- [ ] 能解释为什么深度学习大部分是非凸优化
## 计算机
- [ ] 能看懂别人写的 PyTorch 训练循环
- [ ] 知道 GPU 和 CPU 在矩阵运算上的速度差异数量级
- [ ] 能在 Linux 上跑通 GitHub 上的开源项目
## 数据
- [ ] 能识别常见的数据类型(表格/文本/图像/时序)
- [ ] 知道数据清洗的标准流程
- [ ] 理解 distribution shift 为什么会破坏模型
## AI 基础理论
- [ ] 能说清 5 种学习方式的区别和典型应用
- [ ] 知道训练评估的常见指标和陷阱(数据泄漏、指标好≠效果好)
- [ ] 能解释 Embedding 为什么能做相似度检索
## 经典 ML
- [ ] 能用一句话说清每个模型在解决什么问题
- [ ] 知道逻辑回归是分类不是回归
## 神经网络
- [ ] 能手推一次反向传播(小网络)
- [ ] 知道激活函数为什么必须非线性
- [ ] 理解 loss.backward() 背后发生了什么
## 深度学习架构
- [ ] 能解释 CNN 的卷积核在做什么
- [ ] 能解释 RNN 的梯度消失问题
- [ ] 能解释 Attention 的 Q/K/V 含义
- [ ] 能解释 Transformer 为什么能并行训练
- [ ] 知道 GAN 和扩散模型的本质区别
## 方向
- [ ] 选定至少 1 个主攻方向
- [ ] 读了该方向 3-5 篇代表作论文原文来源:抖音 @你没活干吗 系列[上集:入行的 AI 学习路线][下集:基础之后的方向]