LLM-09入门 → 进阶32 min

AI 学习路线:从入行到方向选择的完整地图

把"数学→计算机→数据→AI 基础理论→经典模型→神经网络→深度学习架构→主流方向"八层知识串成一条线,附必读论文清单。一篇文章回答"我要按什么顺序学 AI"。

学习路线数学基础ML 基础Transformer方向选择

这是一篇路线图,不是单点教程。适合刚准备入行/转岗 AI 的工程师, 也适合已经做了一段时间但"基础不牢"想回头补的同学。原文来自抖音 @你没活干吗 的两期视频(上:入行路线 / 下:基础之后的方向), 我把内容精修、纠错、扩成了这张完整地图。

一句话总结

AI 学习就是打地基再盖楼。地基四层是数学 / 计算机 / 数据 / AI 基础理论, 楼体是经典 ML → 神经网络 → 深度学习架构 → 主流方向。跳着学一定会崩,但每层只学"够用就行", 不要变成数学系毕业生才算入门。

为什么数学是第一道坎

提到 AI,大家第一反应就是高薪、前沿。但如果你想在这个领域里走得远,最绕不开的就是数学。 在 AI 里学数学的目的不是做题,而是看懂模型的设计逻辑。 所以每一个数学知识点,都要回答一个问题:它在 AI 里到底负责什么

下面这张图是 AI 学习的完整知识地图(按从底到顶的依赖关系组织):

ai_learning_roadmap.mermaid
flowchart TD
    M[数学基础<br/>线性代数/微积分/概率统计/最优化/信息论/数值分析]
    CS[计算机基础<br/>编程/数据结构/Linux/Git/GPU]
    D[数据基础<br/>类型/清洗/标注/分布]
    T[AI 基础理论<br/>学习方式/模型评估/训练优化/表示学习]
    CM[经典 ML 模型<br/>线性回归/逻辑回归/树/SVM/PCA/HMM]
    NN[神经网络基础<br/>神经元/MLP/反向传播/激活函数/自动求导]
    DL[深度学习架构<br/>CNN/RNN/Attention/Transformer/GAN/Diffusion]
    DR[主流方向<br/>NLP/CV/具身智能]

    M --> T
    CS --> NN
    D --> T
    T --> CM --> NN --> DL --> DR

① 数学基础(七门学科到底学什么)

1.1 线性代数

AI 里的一张图、一句话最后都会变成数字。这些数字通常不是一个单个的数,而是一个向量矩阵。 神经网络每一层都在做矩阵运算——把向量旋转、拉伸、投影,直到初始向量和想要的向量重合,就算得到了结果。

学习重点:数形结合,不要死算行列式。要理解:

矩阵 = 空间变换

向量 = 空间里的点或方向

神经网络层 = 多次线性变换 + 一次非线性

1.2 微积分

AI 训练的核心是:先算模型预测错了多少(损失),再算一个可量化的值(梯度),然后根据值的大小调整参数。 深度学习训练靠的就是微积分,尤其是反向传播

神经网络之所以能学习,是因为我们能计算损失函数对每一个参数的导数。 学习重点不是求导公式,而是理解:导数 = 神经网络里的变化率,梯度 = 损失下降最快的方向

1.3 概率论与统计学

概率论研究不确定性。AI 面对的数据通常不是绝对确定的(这张图 90% 是猫、10% 是狗——AI 本质上就是给出一个可能性)。

进阶要学随机过程(不是单纯的概率论):处理连续变化的随机现象(机器人一步步在环境里干什么、股票价格变化)。 重点理解 Markov 链高斯过程——后期在扩散模型加噪去噪、强化学习环境建模都会用到。

统计学则是反向工程:从有限数据里反推规律。训练前检查数据是否可靠、训练后检查模型是否过拟合——这些都属于统计学范畴。 数据分布漂移(distribution shift)也是统计学的活。

1.4 最优化理论

最优化理论就是"怎么让一个目标尽可能好"。AI 训练的目标是让损失函数尽可能小、模型效果尽可能好——所以训练模型本质就是优化问题

真实深度学习大部分都是非凸优化,损失函数不是简单的碗状。如果你没学过最优化,遇到"模型不收敛、效果差"会少一个思考角度。

1.5 信息论

AI 任务本质上是处理信息。LLM 里的 next token prediction 就是信息论的应用。 不用深入推香农定理,只要理解交叉熵KL 散度这些概念就够了。

1.6 数值分析

AI 模型在计算机上跑,计算机只能做到有限精度的计算——就会出现梯度爆炸、梯度消失这些问题。 深度学习本质上是大规模数值计算,做 inference 或大模型系统的同学需要深入学一下。

数学到底学到多深?目标是能看懂论文里的公式、能复现模型设计逻辑。别去做考研 1000 题, 那不是 AI 数学。做 LLM 推理优化的同学可以多花时间在数值分析上;做应用层的同学概率论+线代够用。

② 计算机基础(三天五天学完)

AI 最终要变成代码和系统运行。计算机基础是"够用即可"的一层,不应该耗太多时间。

编程基础:现在 AI 工具能帮忙写代码,但要能看懂它在干什么。基础语法、逻辑知道就好。

数据结构:理解数据在计算机里怎么组织(数组/链表/树/图/哈希)。

Linux + Git:操作系统和版本管理工具。知道怎么回事、能在项目里拉 GitHub 代码就行。

GPU / TPU:加速矩阵计算的硬件。去了解一下市面上型号(4090、A100、A800、H100),知道哪些适合训练、哪些适合推理。

学习节奏:整个计算机基础三天五天一周大概就能学完。卡太久说明方向错了——这些不是 AI 学习的核心,是工具熟练度。

③ 数据基础(数据比模型更重要)

数据质量经常比模型结构更重要。同一个模型,用好数据和坏数据的训练效果可能完全不一样。 数据工程的 4 个子模块:

数据类型:表格、文本、图像、音频、视频、时序。不同数据类型对应不同模型(图像用 CNN/ViT,文本用 Transformer)。

数据清洗:去重、去噪、修正异常值、统一格式。数据越脏,模型越容易学到错误规律。

数据标注:监督学习依赖标注。有的公司招"AI 数据运营"岗其实就是干标注。

数据分布:模型上线后经常遇到分布漂移(distribution shift)——把统计学学好的话这块根本没问题。

④ 怎么读论文

AI 发展非常快,最新知识都出现在论文或技术报告里。论文语言密度高、有些论文包装性强实际贡献有限。 看论文只要看清三件事:问题 / 方法 / 实验

熟练后的阅读流程:

1. 先看 abstract:这篇论文干了什么、贡献在哪

2. 看 实验部分:效果怎么样、是不是真的比 baseline 强

3. 看 方法部分:怎么做到的、关键模块是什么

4. 判断哪些模块真正有贡献(是作者提出的还是套用别人的)

⑤ AI 基础理论

5.1 学习方式(5 种)

不同的学习方式数据和模型都不一样。但不要把学习方式和模型架构搞混——同一种 Transformer 可以用不同的学习方式。

learning_paradigms.py
# 5 种学习方式对照表
paradigms = {
    "监督学习":   "给输入+标准答案,学习映射关系",
    "半监督学习": "少量标签 + 大量无标签数据一起训练",
    "无监督学习": "没有标准答案,模型自己探索数据规律",
    "自监督学习": "数据本身构造训练目标(如GPT用前文预测下一词)",
    "强化学习":   "通过奖励/试错学习行动策略(机器人、Agent)",
}

# 典型例子
examples = {
    "监督学习":   "图像分类、房价预测",
    "半监督学习": "医疗影像(标注贵)",
    "无监督学习": "聚类、降维",
    "自监督学习": "GPT/BERT 预训练",
    "强化学习":   "AlphaGo、RLHF",
}

5.2 模型评估

一个模型真正有价值的,是遇到新数据它仍然能表现得不错(泛化能力)。 AI 最终要用于真实世界,所以不能只看训练 loss,还要看鲁棒性不确定性

评估涉及的维度:指标设计、交叉验证、数据泄漏检测、鲁棒性测试、Benchmark 选型。

详见 LLM-08 模型评估

5.3 训练优化

现在的 AI 能力不是写死的,是在训练过程当中学出来的。难点不是机械性降 loss,而是理解损失函数和优化器的关系

training_loop.py
# 训练四大件
loop = {
    "损失函数": "loss = model.error(prediction, target)  # 衡量模型错得多严重",
    "优化器":   "optimizer = Adam/SGD               # 决定怎么调整参数",
    "梯度下降": "param = param - lr * gradient       # 沿损失下降方向更新",
    "正则化":   "loss = loss + lambda * L2(weights)  # 防止过度记住训练集",
}

# 学习率(最敏感的超参)
learning_rate_guide = {
    "太大": "loss 震荡、不收敛",
    "太小": "loss 下降极慢、卡在局部最优",
    "判断方法": "看训练曲线 + 用 Learning Rate Finder",
}

5.4 表示学习

表示学习是从传统 ML 走向深度学习的关键。传统 ML 依赖人工特征,深度学习强调模型自动学习表示。 表示空间里可以做相似度、做分类、迁移到下游任务。

特征表示:把原始数据变成模型可用的信息

Embedding:语义相似的词在向量空间里也接近(猫和狗的向量比猫和汽车更接近)

对比学习:拉近相似样本、推远不相似样本(CLIP、SimCLR)

迁移学习:一个任务学到的能力迁移到另一个任务

⑥ 经典机器学习模型

传统 ML 模型是很多深度学习思想的前身,论文和项目里经常作为 baseline。 理解每一类模型的问题为什么被替代哪些思想保留——这才是学习经典模型的意义。

classic_ml_map.py
# 经典 ML 模型对照
classic_ml = {
    "线性回归":     "用直线/线性公式预测连续值",
    "逻辑回归":     "用 sigmoid 把线性输出变成 0-1 概率(二分类)",
    "决策树":       "if-then 切分特征,直观易解释,但容易过拟合",
    "随机森林":     "很多棵树一起投票(集成学习思想)",
    "SVM":          "找使间隔最大化的分类超平面(理解分类边界)",
    "PCA":          "找到数据主要变化方向,用更少维度保留更多信息(降维/去噪)",
    "HMM 隐马尔可夫": "序列建模的鼻祖,NLP 早期重要基础",
}

几个关键纠错点(容易混淆):

逻辑回归虽然名字带"回归",但主要做分类

决策树通过不断切分特征把数据分类,单棵树容易过拟合 → 随机森林集成解决

SVM的核心是"找到使间隔最大的分界线"(不是离样本越远越好)

PCA是降维,本质是线性代数里的特征值分解,和信息论有天然联系

⑦ 神经网络基础

上面这些本质上都是神经网络的拓展。了解它的基本构成,是后续深度学习架构的基础。

7.1 神经元与 MLP

神经网络最小计算单元是神经元;神经元多了就是MLP(多层感知机)。 数据从输入层一层层经过模型得到预测结果,这个过程叫前向传播

7.2 反向传播

模型先算出预测错误,再从输出层往前一层层计算每个参数应该怎么改。必须理解并手推一次反向传播——这是训练所有神经网络的基础。

7.3 激活函数

为了给网络引入非线性,引入了激活函数(ReLU、Sigmoid、Tanh、GeLU)。 没有激活函数,无论多少层神经网络都等价于单层线性变换

7.4 自动求导

现代深度学习框架能训练复杂模型,靠的就是自动求导。 写好前向计算,框架自动搭计算图反向算梯度——比如 PyTorch 的 loss.backward() 就是自动计算参数梯度。

pytorch_basics.py
import torch
import torch.nn as nn

# 1. 最简单 MLP
model = nn.Sequential(
    nn.Linear(784, 256),   # 输入层 → 隐藏层1
    nn.ReLU(),             # 激活函数
    nn.Linear(256, 128),   # 隐藏层1 → 隐藏层2
    nn.ReLU(),
    nn.Linear(128, 10),    # 隐藏层2 → 输出层
)

# 2. 前向传播
x = torch.randn(32, 784)   # batch_size=32
logits = model(x)          # → (32, 10)

# 3. 损失 + 反向传播(自动求导)
loss = nn.CrossEntropyLoss()(logits, torch.randint(0, 10, (32,)))
loss.backward()            # ← 这里就是自动求导,框架算所有参数的梯度

# 4. 优化器更新参数
optimizer = torch.optim.Adam(model.parameters(), lr=1e-3)
optimizer.step()
optimizer.zero_grad()

⑧ 深度学习经典架构

不同数据结构对应不同架构。下面按"解决什么问题 → 为什么被替代 → 留下什么思想"的逻辑展开。

8.1 CNN(计算机视觉)

CNN 是 CV 的基础。核心思想:局部感受野 + 参数共享,让模型天然适合处理图像。

cnn_evolution.py
cnn_history = {
    "LeNet-5 (1998)":  "最早的 CNN 雏形,手写数字识别",
    "AlexNet (2012)":  "ImageNet 比赛冠军,深度 CNN 成为 CV 主流",
    "VGG (2014)":      "全用 3×3 卷积堆叠,结构规整",
    "ResNet (2015)":   "残差连接让深层网络可训练,'学习变化量'而非'整个映射'",
    "ViT (2020)":      "把 Transformer 引入视觉,图像切 patch 当 token",
    "SAM (2023)":      "Segment Anything,视觉基础模型做通用分割",
}

8.2 RNN(序列建模)

RNN 是序列建模的历史基础。理解 RNN 训练为什么容易梯度消失,才能理解后来为什么需要 LSTM 和 Transformer。

LSTM是 RNN 的改进版:通过门控机制控制信息保留和遗忘,解决了 RNN 记不住长距离信息的问题。

8.3 Attention 注意力机制(现代 AI 核心)

Attention 是现代 AI 核心思想之一。模型处在一个位置时,可以主动去关注其他重要的位置。 翻译一句话生成当前词时,不一定只看前一个词,而是看整句话里最相关的几个词。

必须理解:Attention 里的 Q / K / V 到底是什么;为什么 Attention 能做到长距离依赖

attention_qkv.py
# 注意力机制的简化版(理解 Q/K/V)
import numpy as np

def attention(Q, K, V):
    # Q: Query  (n, d_k)   - 当前 token 在"问"什么
    # K: Key    (m, d_k)   - 每个 token 在"声明"自己是什么
    # V: Value  (m, d_v)   - 每个 token 实际携带的信息

    # 1. Q · K^T: 计算每个 query 和每个 key 的相关度
    scores = np.dot(Q, K.T)             # (n, m)

    # 2. 缩放(防止点积过大)+ softmax: 转成概率分布
    d_k = K.shape[-1]
    weights = np.exp(scores / np.sqrt(d_k))
    weights = weights / weights.sum(axis=-1, keepdims=True)  # (n, m)

    # 3. 用权重对 V 加权求和: 取出最相关的信息
    output = np.dot(weights, V)         # (n, d_v)
    return output, weights

# 类比:查字典
#   Q = "我要查的问题"
#   K = "字典里每个词的索引"
#   V = "字典里每个词的内容"
#   attention = "根据问题,从字典里挑出最相关的几个词的内容"

8.4 Transformer(AI 爆发的起点)

AI 爆发就是从 Transformer 提出开始的——GPT / Claude / Gemini / LLaMA 等所有大模型都是基于 Transformer。 以 Attention 为核心,可以并行处理一整段输入,用 self-attention 衡量各位置关系。

Transformer 是现代 AI 的基石,必须熟练、必须学会。

8.5 GAN 与扩散模型(生成模型)

GAN(生成对抗网络):由生成器和判别器对抗训练。生成器生成的样本越来越真。 现在图像生成主流更多是扩散模型,但 GAN 的对抗思想仍是理解生成模型的重要基础。

扩散模型(Diffusion Model):训练时一步加噪,生成时一步去噪。 现在的图像/视频生成(Stable Diffusion、Sora、Midjourney)全用扩散模型。

diffusion_intuition.py
# 扩散模型直观理解
diffusion_process = {
    "前向(加噪)":  "真实图 → 加噪 → 全部噪点     [训练时使用]",
    "反向(去噪)":  "纯噪点 → 逐步去噪 → 真实图    [生成时使用]",
    "核心思想":      "如果模型能学会'去噪一步',那它就能从纯噪点开始一步步去噪生成图",
}

8.6 自编码器(表示学习)

自编码器是理解表示学习 / 压缩去噪 / 生成模型的基础。 模型学一个"压缩到隐空间 → 再重建出来"的过程,核心是学到有用的表示

⑨ 主流研究方向与必读论文

学完前面八层,开始划分方向。不用每个方向都学,简要介绍 3 个主流:

9.1 NLP(自然语言处理)

让机器理解和生成人类语言。通过大规模预训练获得通用语言能力,再通过指令微调变成可对话、可推理的工具。

子方向:预训练模型、大模型架构、微调对齐、Agent、代码大模型等。

nlp_must_read.py
# NLP 必读论文(按发表顺序)
nlp_papers = [
    ("Transformer",  "2017", "把注意力机制变成主流架构"),
    ("BERT",         "2018", "双向预训练语言理解"),
    ("GPT-2/3",      "2019-20", "开放技术的大语言模型"),
    ("InstructGPT",  "2022", "RLHF 三阶段对齐的代表作"),
    ("LLaMA",        "2023", "开源大模型(Meta)"),
    ("RAG",          "2020", "把参数知识和外部检索结合"),
]

9.2 CV(计算机视觉)

让机器看懂图像和视频。从早期 CNN 提取边缘纹理 → ResNet 解决深层训练 → ViT 把图像切成 patch → SAM 等视觉基础模型做通用分割。

9.3 具身智能(Embodied AI)

让机器在真实环境里执行动作。和大模型最重要的区别是:大模型处理语言和知识,具身智能处理物理环境和动作执行。

需要补充控制理论传感系统知识。目前 RT-2 是 VLA(视觉-语言-动作)模型的一个代表——把视觉-语言指令和机器人控制结合,把动作表示成类 Token 形式。

方向选择建议:看你的专业背景 + 应用场景。做电商选 LLM/RAG/Agent;做图像选 CV/多模态;做硬件选具身智能/边缘部署。基础相通——前面八层打扎实,转方向成本很低。

附:自检清单

回头对照这个清单自查:

self_check.md
# AI 学习自检清单

## 数学
- [ ] 能解释矩阵是空间变换、向量是空间里的点/方向
- [ ] 能用一句话解释反向传播为什么能让神经网络学习
- [ ] 知道 KL 散度、交叉熵在 LLM 里起什么作用
- [ ] 能解释为什么深度学习大部分是非凸优化

## 计算机
- [ ] 能看懂别人写的 PyTorch 训练循环
- [ ] 知道 GPU 和 CPU 在矩阵运算上的速度差异数量级
- [ ] 能在 Linux 上跑通 GitHub 上的开源项目

## 数据
- [ ] 能识别常见的数据类型(表格/文本/图像/时序)
- [ ] 知道数据清洗的标准流程
- [ ] 理解 distribution shift 为什么会破坏模型

## AI 基础理论
- [ ] 能说清 5 种学习方式的区别和典型应用
- [ ] 知道训练评估的常见指标和陷阱(数据泄漏、指标好≠效果好)
- [ ] 能解释 Embedding 为什么能做相似度检索

## 经典 ML
- [ ] 能用一句话说清每个模型在解决什么问题
- [ ] 知道逻辑回归是分类不是回归

## 神经网络
- [ ] 能手推一次反向传播(小网络)
- [ ] 知道激活函数为什么必须非线性
- [ ] 理解 loss.backward() 背后发生了什么

## 深度学习架构
- [ ] 能解释 CNN 的卷积核在做什么
- [ ] 能解释 RNN 的梯度消失问题
- [ ] 能解释 Attention 的 Q/K/V 含义
- [ ] 能解释 Transformer 为什么能并行训练
- [ ] 知道 GAN 和扩散模型的本质区别

## 方向
- [ ] 选定至少 1 个主攻方向
- [ ] 读了该方向 3-5 篇代表作论文

原文来源:抖音 @你没活干吗 系列[上集:入行的 AI 学习路线][下集:基础之后的方向]