AI 学习路线 · 入门
Part 3 · 大模型原理 · 面试深入
数学基础、机器学习、神经网络、词向量、思维链等面试必考原理
Section 1 · 数学基础·够用版(线性代数)
Subsection 1 · 只学 4 个东西
打开 B 站搜 线性代数 向量 矩阵 通俗,看 30 分钟。你只需要懂 4 个词:
标量 单个数字 例:5向量 一串数字 例:[1,2,3]矩阵 二维表格数字 例:2行3列点积 两个向量"配对相乘再相加",用来算相似度- 你 Part 2 · Section 9 已经用过点积(torch.dot),现在给它起上名字而已。
Subsection 2 · 在代码里认一遍
VS Code 新建 math_demo.py:
import torchv1 = torch.tensor([1.0, 2.0, 3.0])v2 = torch.tensor([4.0, 5.0, 6.0])print("向量相加:", v1 + v2) # 对应位置相加print("点积(相似度):", torch.dot(v1, v2).item()) # 1*4+2*5+3*6=32- 预期看到:
向量相加: tensor([5., 7., 9.])和点积(相似度): 32.0
过关:能说出标量/向量/矩阵/点积各是什么 = Section 1 完成。
Section 2 · 数学基础·够用版(概率统计)
Subsection 1 · 懂 3 个词
B 站搜 概率论 条件概率 贝叶斯 通俗 看 30 分钟。记 3 个词:
概率 P(A) 事件 A 发生的可能性,0~1条件概率 P(A|B) 已知 B 发生,A 发生的概率贝叶斯公式 "根据结果反推原因",模型判断的关键- 面试常问"朴素贝叶斯怎么分类"——就是"根据词算它是哪类"的贝叶斯应用。
Subsection 2 · 一句人话总结 备忘录写:
贝叶斯 = 我用看到的证据(词),去反推它最可能是哪一类(好评/差评)。
过关:能解释"条件概率"和"贝叶斯"大概意思 = Section 2 完成。
Section 3 · 机器学习三大类(概念日)
Subsection 1 · 记三句话
B 站搜 监督学习 无监督学习 半监督学习 区别 看 20 分钟。记:
监督学习 有标签(答案)→ 学映射 例:垃圾邮件分类(每条标了好/坏)无监督学习 没标签 → 找结构 例:把客户自动分成几类半监督学习 少量标签 + 大量没标签 例:只有 100 条标注,还有 1 万条没标Subsection 2 · 对号入座 判断下面各属于哪类(答案在文末):
- 给一堆猫狗照片,让模型自己把相似的归一组
- 给照片+标签(猫/狗)训练识别
- 有 50 张标好的 + 5000 张没标的
过关:能说出三类区别 = Section 3 完成。 (答案:1 无监督 2 监督 3 半监督)
Section 4 · TF-IDF + 朴素贝叶斯(第一个"机器学习"代码)
Subsection 1 · 概念 10 分钟
TF-IDF = 给每个词打分:在本文出现多(重要) × 在所有文章里少见(更独特)朴素贝叶斯分类 = 看"这条文本里出现了哪些词",算它属于哪一类概率最高Subsection 2 · 跑代码
VS Code 新建 nb_classify.py:
import jiebafrom sklearn.feature_extraction.text import TfidfVectorizerfrom sklearn.naive_bayes import MultinomialNBtexts = [ "质量很好 速度快", "好用 推荐 值得买", "很垃圾 差评", "太慢了 后悔", "产品不错 值得购买", "这个性价比很高 五星好评",]labels = [1, 1, 0, 0, 1, 1]# 用 jieba 分词:把整串词切成真正的词def cut(text): return " ".join(jieba.cut(text))# TF-IDF 把文字变成数字vec = TfidfVectorizer(tokenizer=cut) X = vec.fit_transform(texts)# 训练朴素贝叶斯clf = MultinomialNB().fit(X, labels)# 预测新句子new = ["这个产品不错 值得购买"]X_new = vec.transform(new)print("新句命中词:", vec.get_feature_names_out()[X_new.toarray()[0] > 0])print("预测:", "好评" if clf.predict(X_new)[0] == 1 else "差评")- 先装 sklearn和jieba:cmd 里
pip install scikit-learnpip install jieba(慢就加清华源) - 运行
- 预期看到:
预测: 好评
过关:能跑出"好评" = Section 4 完成。
Section 5 · SVM / 逻辑回归 / Softmax(术语认识)
Subsection 1 · 记三个术语
B 站搜 SVM 支持向量机 通俗 和 softmax 通俗 各看 10 分钟。记:
SVM 找一个"分界线"把两类尽量分开,分界线离两边都最远逻辑回归 输出一个 0~1 的概率(比如 0.8 = 80% 好评)Softmax 把一组分数变成一组"加起来=1"的概率,大模型最后一步用它选词- Softmax 最重要:大模型生成下一个词,就是拿所有词的分数过一遍 Softmax,挑概率最高的。
Subsection 2 · 过关自测 能回答:① SVM 干嘛的 ② Softmax 输出有什么特点(加起来=1)。 答得出 = Section 5 完成。
Section 6 · 神经网络基础(感知机到多层)
Subsection 1 · 看视频
B 站搜 神经网络 工作原理 3Blue1Brown 看前 3 集(每集 10 分钟左右,讲得最清楚)。
- 记:
神经元 一个"小函数":输入×权重 + 偏置 → 激活函数 → 输出多层网络 很多神经元分层连接,能学复杂模式反向传播 根据"错多少"从后往前调权重,让模型越来越准Subsection 2 · 一句话总结 备忘录写:
神经网络 = 一堆带权重的神经元堆叠;训练 = 反复"做题-看错多少-调权重",直到答对。
过关:能解释"训练就是调权重" = Section 6 完成。
Section 7 · 词向量进化史(面试高频)
Subsection 1 · 记时间线
B 站搜 词向量 word2vec BERT 区别 看 20 分钟。记:
TF-IDF 每个词一个"出现次数"数字 → 看不出意思Word2Vec 每个词一个向量 → "国王-男人+女人≈女王"(向量能算关系)GloVe 类似 Word2Vec,用共现统计ELMo 同一个词在不同句子给不同向量(第一次"上下文相关")BERT Transformer 编码 → 每个词根据整句理解 → 大模型前身- 一句话:从"一个词一个死向量"到"一个词根据上下文活向量"。
Subsection 2 · 过关自测 能说出:① 词向量能算"国王-男人+女人"意味着什么 ② BERT 比 Word2Vec 强在哪。 答得出 = Section 7 完成。
Section 8 · RNN / LSTM(认识即可)
Subsection 1 · 记两个词
B 站搜 RNN LSTM 区别 通俗 看 20 分钟。记:
RNN 逐个读序列,但"记不住太远的"(读到后面忘前面)LSTM 加了"记忆闸门",能记住长时间信息 → 被 Transformer 取代- 现在主流已经是 Transformer,RNN/LSTM 面试可能问,知道"是什么、被谁取代"就够。
Subsection 2 · 过关自测 能说"RNN 的问题是什么、谁取代了它" = Section 8 完成。
Section 9 · 预训练与分布式训练(概念)
Subsection 1 · 记概念
B 站搜 大模型 预训练 分布式训练 看 20 分钟。记:
预训练 在海量文本上学"预测下一个词",吸收通用知识分布式训练 一个模型太大,一台机器放不下 → 多台 GPU 分工- 数据并行 每台存同一模型,分不同数据- 模型并行 模型拆开放多台- 流水线并行 分层给不同机器,像流水线Subsection 2 · 过关自测 能说"为什么大模型必须分布式训练" = Section 9 完成。
Section 10 · 推理规划:思维链 CoT(面试必考)
Subsection 1 · 亲手试一次思维链 打开 DeepSeek,输入:
Q: 商店有 15 个苹果,卖出 7 个,又进货 5 个,现在有几个?请一步步推理再给答案。- 预期看到:模型先写"15-7=8,8+5=13",再给答案 13。
- 再试不给"一步步推理"的版本,对比。
- 这就是 CoT(Chain-of-Thought,思维链):让模型把推理过程写出来,答案更准。
Subsection 2 · 记两个进阶词
Least-to-Most 先解决简单子问题,再解决难问题(由少至多)思维树 ToT 不只一条链,而是分叉探索多条路再挑最好的过关:能说清"CoT 为什么让模型更准" = Section 10 完成。
Section 11 · LLM 加速技术(记住名字和用途)
Subsection 1 · 记四个加速技术
B 站搜 FlashAttention PagedAttention 原理 看 20 分钟。记:
FlashAttention 优化注意力计算,快且省显存PagedAttention 显存像内存分页一样管理,不浪费(vLLM 的核心)CPU 推理 显存不够时用内存/CPU 跑(慢但能跑)推理优化框架 vLLM / TensorRT-LLM 等,把这些技术打包好- 你不用实现它们,但要能在面试时说出"解决什么问题"。
Subsection 2 · 过关自测 能说出 FlashAttention 和 PagedAttention 各解决什么问题 = Section 11 完成。
Section 12 · 强化学习基础 + 站 2B 验收
Subsection 1 · 记 RL 四件套
B 站搜 强化学习 入门 通俗 大模型 看 30 分钟。记:
Q-learning 教 agent"在某个状态做哪个动作收益最高",记成一张表DQN 用神经网络代替那张表(深度 Q 网络)Policy Gradient 直接学"怎么选动作",做得好的动作概率调大Actor-Critic 两个网络配合:Actor 选动作,Critic 打分- 大模型里的 RLHF 就是:先让模型说人话(SFT),再让奖励模型打分,用 PPO(Actor-Critic 家族)调优。这个 Part 4 · Section 25 会串起来。
Subsection 2 · Part 3 验收勾选
- 能说出线性代数 4 个基础词(标量/向量/矩阵/点积)
- 能解释贝叶斯/条件概率,并能对号入座三类机器学习
- 跑通了朴素贝叶斯文本分类(Section 4)
- 能说出 SVM / 逻辑回归 / Softmax 各自作用
- 能解释"神经网络训练 = 调权重"(反向传播)
- 能画出词向量进化线(TF-IDF → Word2Vec → ELMo → BERT)
- 能说 RNN 的缺点和替代者
- 能说分布式训练为什么必要
- 能演示一次思维链 CoT 并解释
- 能说出 FlashAttention / PagedAttention 解决什么问题
- 能说出强化学习四件套 + RLHF/PPO 在其中的位置
全勾选 = Part 3 通过 → 进入下一站 Part 4 · 大模型原理 · 进阶可选(从零写迷你模型 + RLHF 精读)。
