返回学习路线

AI 学习路线 · 入门

Part 3 · 大模型原理 · 面试深入

数学基础、机器学习、神经网络、词向量、思维链等面试必考原理


Section 1 · 数学基础·够用版(线性代数)

Subsection 1 · 只学 4 个东西 打开 B 站搜 线性代数 向量 矩阵 通俗,看 30 分钟。你只需要懂 4 个词:

标量    单个数字        例:5向量    一串数字        例:[1,2,3]矩阵    二维表格数字     例:2行3列点积    两个向量"配对相乘再相加",用来算相似度
  • 你 Part 2 · Section 9 已经用过点积(torch.dot),现在给它起上名字而已。

Subsection 2 · 在代码里认一遍 VS Code 新建 math_demo.py:

python
import torchv1 = torch.tensor([1.0, 2.0, 3.0])v2 = torch.tensor([4.0, 5.0, 6.0])print("向量相加:", v1 + v2)          # 对应位置相加print("点积(相似度):", torch.dot(v1, v2).item())  # 1*4+2*5+3*6=32
  • 预期看到:向量相加: tensor([5., 7., 9.]) 和 点积(相似度): 32.0

过关:能说出标量/向量/矩阵/点积各是什么 = Section 1 完成。


Section 2 · 数学基础·够用版(概率统计)

Subsection 1 · 懂 3 个词 B 站搜 概率论 条件概率 贝叶斯 通俗 看 30 分钟。记 3 个词:

概率 P(A)          事件 A 发生的可能性,0~1条件概率 P(A|B)     已知 B 发生,A 发生的概率贝叶斯公式          "根据结果反推原因",模型判断的关键
  • 面试常问"朴素贝叶斯怎么分类"——就是"根据词算它是哪类"的贝叶斯应用。

Subsection 2 · 一句人话总结 备忘录写:

贝叶斯 = 我用看到的证据(词),去反推它最可能是哪一类(好评/差评)。

过关:能解释"条件概率"和"贝叶斯"大概意思 = Section 2 完成。


Section 3 · 机器学习三大类(概念日)

Subsection 1 · 记三句话 B 站搜 监督学习 无监督学习 半监督学习 区别 看 20 分钟。记:

监督学习     有标签(答案)→ 学映射      例:垃圾邮件分类(每条标了好/坏)无监督学习   没标签 → 找结构             例:把客户自动分成几类半监督学习   少量标签 + 大量没标签       例:只有 100 条标注,还有 1 万条没标

Subsection 2 · 对号入座 判断下面各属于哪类(答案在文末):

  1. 给一堆猫狗照片,让模型自己把相似的归一组
  2. 给照片+标签(猫/狗)训练识别
  3. 有 50 张标好的 + 5000 张没标的

过关:能说出三类区别 = Section 3 完成。 (答案:1 无监督 2 监督 3 半监督)


Section 4 · TF-IDF + 朴素贝叶斯(第一个"机器学习"代码)

Subsection 1 · 概念 10 分钟

TF-IDF = 给每个词打分:在本文出现多(重要) × 在所有文章里少见(更独特)朴素贝叶斯分类 = 看"这条文本里出现了哪些词",算它属于哪一类概率最高

Subsection 2 · 跑代码 VS Code 新建 nb_classify.py:

python
import jiebafrom sklearn.feature_extraction.text import TfidfVectorizerfrom sklearn.naive_bayes import MultinomialNBtexts = [    "质量很好 速度快",    "好用 推荐 值得买",    "很垃圾 差评",    "太慢了 后悔",    "产品不错 值得购买",      "这个性价比很高 五星好评",]labels = [1, 1, 0, 0, 1, 1]# 用 jieba 分词:把整串词切成真正的词def cut(text):    return " ".join(jieba.cut(text))# TF-IDF 把文字变成数字vec = TfidfVectorizer(tokenizer=cut) X = vec.fit_transform(texts)# 训练朴素贝叶斯clf = MultinomialNB().fit(X, labels)# 预测新句子new = ["这个产品不错 值得购买"]X_new = vec.transform(new)print("新句命中词:", vec.get_feature_names_out()[X_new.toarray()[0] > 0])print("预测:", "好评" if clf.predict(X_new)[0] == 1 else "差评")
  • 先装 sklearn和jieba:cmd 里 pip install scikit-learn pip install jieba(慢就加清华源)
  • 运行
  • 预期看到:预测: 好评

过关:能跑出"好评" = Section 4 完成。


Section 5 · SVM / 逻辑回归 / Softmax(术语认识)

Subsection 1 · 记三个术语 B 站搜 SVM 支持向量机 通俗 和 softmax 通俗 各看 10 分钟。记:

SVM       找一个"分界线"把两类尽量分开,分界线离两边都最远逻辑回归  输出一个 0~1 的概率(比如 0.8 = 80% 好评)Softmax   把一组分数变成一组"加起来=1"的概率,大模型最后一步用它选词
  • Softmax 最重要:大模型生成下一个词,就是拿所有词的分数过一遍 Softmax,挑概率最高的。

Subsection 2 · 过关自测 能回答:① SVM 干嘛的 ② Softmax 输出有什么特点(加起来=1)。 答得出 = Section 5 完成。


Section 6 · 神经网络基础(感知机到多层)

Subsection 1 · 看视频 B 站搜 神经网络 工作原理 3Blue1Brown 看前 3 集(每集 10 分钟左右,讲得最清楚)。

  • 记:
神经元   一个"小函数":输入×权重 + 偏置 → 激活函数 → 输出多层网络  很多神经元分层连接,能学复杂模式反向传播  根据"错多少"从后往前调权重,让模型越来越准

Subsection 2 · 一句话总结 备忘录写:

神经网络 = 一堆带权重的神经元堆叠;训练 = 反复"做题-看错多少-调权重",直到答对。

过关:能解释"训练就是调权重" = Section 6 完成。


Section 7 · 词向量进化史(面试高频)

Subsection 1 · 记时间线 B 站搜 词向量 word2vec BERT 区别 看 20 分钟。记:

TF-IDF     每个词一个"出现次数"数字 → 看不出意思Word2Vec   每个词一个向量 → "国王-男人+女人≈女王"(向量能算关系)GloVe      类似 Word2Vec,用共现统计ELMo       同一个词在不同句子给不同向量(第一次"上下文相关")BERT       Transformer 编码 → 每个词根据整句理解 → 大模型前身
  • 一句话:从"一个词一个死向量"到"一个词根据上下文活向量"。

Subsection 2 · 过关自测 能说出:① 词向量能算"国王-男人+女人"意味着什么 ② BERT 比 Word2Vec 强在哪。 答得出 = Section 7 完成。


Section 8 · RNN / LSTM(认识即可)

Subsection 1 · 记两个词 B 站搜 RNN LSTM 区别 通俗 看 20 分钟。记:

RNN   逐个读序列,但"记不住太远的"(读到后面忘前面)LSTM  加了"记忆闸门",能记住长时间信息 → 被 Transformer 取代
  • 现在主流已经是 Transformer,RNN/LSTM 面试可能问,知道"是什么、被谁取代"就够。

Subsection 2 · 过关自测 能说"RNN 的问题是什么、谁取代了它" = Section 8 完成。


Section 9 · 预训练与分布式训练(概念)

Subsection 1 · 记概念 B 站搜 大模型 预训练 分布式训练 看 20 分钟。记:

预训练       在海量文本上学"预测下一个词",吸收通用知识分布式训练   一个模型太大,一台机器放不下 → 多台 GPU 分工- 数据并行  每台存同一模型,分不同数据- 模型并行  模型拆开放多台- 流水线并行 分层给不同机器,像流水线

Subsection 2 · 过关自测 能说"为什么大模型必须分布式训练" = Section 9 完成。


Section 10 · 推理规划:思维链 CoT(面试必考)

Subsection 1 · 亲手试一次思维链 打开 DeepSeek,输入:

Q: 商店有 15 个苹果,卖出 7 个,又进货 5 个,现在有几个?请一步步推理再给答案。
  • 预期看到:模型先写"15-7=8,8+5=13",再给答案 13。
  • 再试不给"一步步推理"的版本,对比。
  • 这就是 CoT(Chain-of-Thought,思维链):让模型把推理过程写出来,答案更准。

Subsection 2 · 记两个进阶词

Least-to-Most   先解决简单子问题,再解决难问题(由少至多)思维树 ToT      不只一条链,而是分叉探索多条路再挑最好的

过关:能说清"CoT 为什么让模型更准" = Section 10 完成。


Section 11 · LLM 加速技术(记住名字和用途)

Subsection 1 · 记四个加速技术 B 站搜 FlashAttention PagedAttention 原理 看 20 分钟。记:

FlashAttention   优化注意力计算,快且省显存PagedAttention   显存像内存分页一样管理,不浪费(vLLM 的核心)CPU 推理         显存不够时用内存/CPU 跑(慢但能跑)推理优化框架     vLLM / TensorRT-LLM 等,把这些技术打包好
  • 你不用实现它们,但要能在面试时说出"解决什么问题"。

Subsection 2 · 过关自测 能说出 FlashAttention 和 PagedAttention 各解决什么问题 = Section 11 完成。


Section 12 · 强化学习基础 + 站 2B 验收

Subsection 1 · 记 RL 四件套 B 站搜 强化学习 入门 通俗 大模型 看 30 分钟。记:

Q-learning        教 agent"在某个状态做哪个动作收益最高",记成一张表DQN               用神经网络代替那张表(深度 Q 网络)Policy Gradient   直接学"怎么选动作",做得好的动作概率调大Actor-Critic      两个网络配合:Actor 选动作,Critic 打分
  • 大模型里的 RLHF 就是:先让模型说人话(SFT),再让奖励模型打分,用 PPO(Actor-Critic 家族)调优。这个 Part 4 · Section 25 会串起来。

Subsection 2 · Part 3 验收勾选

  • 能说出线性代数 4 个基础词(标量/向量/矩阵/点积)
  • 能解释贝叶斯/条件概率,并能对号入座三类机器学习
  • 跑通了朴素贝叶斯文本分类(Section 4)
  • 能说出 SVM / 逻辑回归 / Softmax 各自作用
  • 能解释"神经网络训练 = 调权重"(反向传播)
  • 能画出词向量进化线(TF-IDF → Word2Vec → ELMo → BERT)
  • 能说 RNN 的缺点和替代者
  • 能说分布式训练为什么必要
  • 能演示一次思维链 CoT 并解释
  • 能说出 FlashAttention / PagedAttention 解决什么问题
  • 能说出强化学习四件套 + RLHF/PPO 在其中的位置

全勾选 = Part 3 通过 → 进入下一站 Part 4 · 大模型原理 · 进阶可选(从零写迷你模型 + RLHF 精读)。