返回学习路线

AI 学习路线 · 入门

Part 1 · 大模型基础认知

小白零基础友好。这一站不写代码,只建立"大模型到底是什么"的骨架。


Section 1 · 认识 AI,为什么现在爆了

不需要装任何软件,只需要一台能上网的手机或电脑。这一节的目标只有一个:亲手用上一次 AI,并且搞明白它凭什么这么火。

Subsection 1 · 先弄清楚:AI、机器学习、大模型是什么关系

很多人把这三个词混着用,其实是三层递进关系,记住这个比喻:

  • AI(人工智能):最外面的大筐。只要让机器做出“看起来需要人脑”的事,都算 AI。比如下棋赢人类、识别照片里的猫、听懂你说的话。它从上世纪 50 年代就存在了,不是新东西。

  • 机器学习(Machine Learning):AI 的一种实现方式。不靠人写死规则(“如果图片里有三角形就是猫”),而是给机器大量例子,让它自己总结规律。比如给它 100 万张标好“猫/狗”的图,它自己学会区分。

  • 深度学习 / 大模型(Deep Learning / LLM):机器学习里当前最火的一支。它用“神经网络”这种结构,吃的数据和算力都特别大,能力因此突飞猛进。大语言模型(LLM)就是专门吃“文字”的深度学习模型。

  • 一句话串起来:AI 是目标,机器学习是方法,大模型是当前最厉害的那个工具。你以后做 AI 应用,绝大多数时候是在“用大模型”,而不是从零造大模型。

  • 过关自测:能用自己的话讲清“AI 和机器学习的区别”即可。讲不清就重读上面三行。

Subsection 2 · 机器到底是怎么“学会”的

这一节是全教程第一个“原理要点”,理解它,后面所有概念都顺了。

第一步:先忘掉“智能”这个词。 大模型内部没有“理解”,只有一堆数字在算来算去。它学到的不是“猫的定义”,而是“猫这个字周围经常出现哪些字、哪些词”。

第二步:把文字变成数字。 计算机只认数字。所以模型做的第一件事,是把一句话拆成小块(叫 Token,中文常译“词元”),每块再变成一个向量(一串数字,比如 4096 个数)。比如“我喜欢吃苹果”可能被拆成:我 / 喜欢 / 吃 / 苹果,每个字对应一串数字。

  • 打个比方:Token 像把一整篇文章切成一个个乐高积木块,向量像是每块积木上刻的“坐标”。位置接近的积木(比如“苹果”和“香蕉”),它们的向量在“数字空间”里也挨得近。

第三步:让数字在“神经网络”里流动。 神经网络是一层层连起来的“数字加工厂”。输入是向量,经过几十上百层加工,每层都在做加权求和 + 非线性变换(后面 Section 会细讲“注意力”),最后输出一个结果。

  • 记忆锚点:模型 = 一堆数字(叫“参数”)+ 一套固定的运算规则(叫“结构”)。所谓“训练”,就是不断调整那堆数字,让输出越来越对。

  • 过关自测:① Token 是什么?② “模型训练”在实现上到底改的是什么?答得出即可。

Subsection 3 · 找个能聊天的 AI

  • 用手机:打开应用商店(苹果 App Store / 安卓应用市场)→ 搜索框输入 DeepSeek → 点“获取/安装” → 打开它。
  • 用电脑:打开浏览器(Chrome / Edge)→ 地址栏输入 https://chat.deepseek.com 回车。
  • 没有 DeepSeek 账号就点“注册”,用手机号最快,收个验证码就能进。
  • 预期看到:一个聊天页面,中间一个输入框,底部能打字。
  • 打不开:先检查是不是没联网;换个浏览器再试;还不行就用手机装 App。如果提示“服务繁忙”,等几分钟刷新,这是因为用的人多,不是你的问题。

Subsection 4 · 问它三个问题 在输入框逐条输入,等回答完再问下一条:

  1. 用一句话解释什么是相对论
  2. 写一首关于夏天的五言绝句
  3. 我的代码报错了:FileNotFoundError: [Errno 2] No such file or directory,是什么意思
  • 预期看到:三个回答风格完全不同(科普 / 诗 / 技术),但它都答得上来。
  • 记住这个感受:这就是核心——同一个模型,用不同的话(Prompt)指挥,就能干不同的事。它不会因为换了话题就“卡壳”,这就是大模型和以前“一个模型只会一件事”的本质区别。
  • 补充:你发的每条消息,都会被切成 Token → 变向量 → 过神经网络 → 逐字吐出来。你看到的“回答”,其实是模型一个字一个字猜出来的(下一节讲“预测下一个字”)。

Subsection 5 · 看 20 分钟入门视频

  • 浏览器新开标签页 → 输入 https://courses.d2l.ai/zh-v2/ 回车 → 点页面里第一个视频(《动手学深度学习》第 1 讲)→ 只看前 20 分钟,看到讲神经网络就停。
  • 不想看这个就换:打开 https://www.bilibili.com/video/BV128cUe6EU2/(马士兵 AI 教程)→ 看第 1 集。
  • 预期看到:视频里反复出现“人工智能 / 机器学习 / 深度学习 / 大模型”这些词。不要求听懂,只要求混个脸熟——后面你会反复遇到它们。
  • 视频打不开/很卡:换个视频源,或在 B 站直接搜“大模型 科普”,随便挑个播放量高的看 15 分钟就行,重点是“听过这些词”。

Subsection 6 · 用你的话写三句话 打开备忘录 / 记事本,写下(写不出来就照抄一遍也是学):

  1. AI 是让机器做需要人类智能的事。
  2. 以前是“一个模型只会一件事”(AI 1.0),现在是“一个模型会所有事”(AI 2.0 大模型)。
  3. 大模型现在爆发,是因为算力、数据、Transformer 架构三个都够了。

Subsection 7 · 过关自测 不看上面,回答:① AI 1.0 和 AI 2.0 有啥区别?② 大模型为什么是最近爆的?③ Token 是什么? 能说出来 = Section 1 完成。


Section 2 · 生成式 vs 判别式,大模型和 AGI

这一节认识两个最容易混淆的概念对,它们是理解 AI 的“钥匙”。顺带把“大模型为什么会说人话”这个机制讲透。

Subsection 1 · 用 AI 感受两种任务 打开昨天那个 DeepSeek,问:

  1. 判断这句话是正面还是负面评价:今天外卖迟到了 ← 这是“判别式”任务(做判断/分类)
  2. 写一首关于夏天的五言绝句 ← 这是“生成式”任务(凭空造内容)
  • 预期看到:第一个回答是“负面”,第二个是“一首诗”。
  • 记住口诀:判别式“挑”,生成式“造”。大语言模型(LLM)是生成式的——它每次都在“从无到有”生成新文字,而不是在现成选项里挑一个。
  • 为什么这个区别重要:以后你设计产品,要先想清楚“我是让 AI 做判断,还是让 AI 造内容”,两者用的模型、接口、评估方式都不一样。

Subsection 2 · 大模型是怎么“预测下一个字”的

这是全教程最重要的机制,一定要吃透:

核心一句话:大语言模型的本质,是一个“猜下一个字”的机器。

  • 你输入 床前明月,它开始猜:下一个字最可能是“光”(因为古诗词里“床前明月光”出现频率极高)。

  • 它继续:床前明月光,再猜下一个字“,”。就这样一个 token 一个 token 地往后蹦,直到它认为该停了,或者到达你设置的长度上限。

  • 核心流程(记住这四个词):切词(Tokenize)→ 变向量(Embedding)→ 过网络(Transformer)→ 选下一个(Sampling)。

  • 每一次“猜”,它不是只猜一个,而是给整个词表里每一个 token 算一个概率。比如“光”概率 0.7、“霜”概率 0.2、“水”概率 0.05……然后按概率挑一个。所以同一句话问两次,答案可能略有不同——这不是 bug,是概率采样(有个叫“温度 temperature”的参数控制随机程度,后面 API 那站会教)。

  • 训练时做什么?给模型海量文本,让它不断“看着前面的字,预测下一个字”,预测错了就调整那堆参数,让下次猜得更准。这个过程叫预训练(Pre-training)。模型看过的文本越多、参数越多、算力越强,猜得就越准,看起来就越“聪明”。

  • 过关自测:① 用一句话说出大模型的本质。② “温度”高一点,回答会怎样?(提示:更随机/更发散)

Subsection 3 · 看 5 分钟科普

  • 浏览器打开 https://www.bilibili.com/video/BV1uNk1YxEJQ(黑马 AI 零基础)→ 看第 1~2 集。
  • 没时间就在 B 站搜 生成式模型 判别式模型 区别,看 5 分钟。
  • 预期看到:视频里出现“大语言模型、预训练、生成式”这些词。

Subsection 4 · 记住两个定义 在备忘录里加两行(照抄):

  1. LLM(大语言模型)= 基于 Transformer、在海量文本上预训练、能理解并生成文字的生成式模型。
  2. AGI(通用人工智能)= 像人一样能干所有事的目标;大模型是离它最近的一步,但还不是 AGI(会幻觉、不会持续学习)。

Subsection 5 · 过关自测 ① 脱口说出“LLM 是什么”(三个关键词:Transformer / 预训练 / 生成式)。② 大模型 = AGI 吗?为什么?③ 大模型生成文字的本质是什么? 答得出 = Section 2 完成。


Section 3 · 国外主流大模型

这一节让你知道“有哪些大玩家”,并且分清“开源”和“闭源”这个影响你未来所有决策的分水岭。顺带认识“参数量”这个衡量模型大小的尺子。

Subsection 1 · 扫一眼模型生态

  • 打开 https://huggingface.co/models → 滚一滚,看有哪些模型卡片(认得出 GPT、Llama、Mistral、Qwen 就够)→ 截图。
  • 再打开 https://github.com/trending → 看最近热门的项目 → 截图。
  • 预期看到:很多模型/项目名字,大部分不认识——这很正常,这一节只建立“生态很大”的直觉。Hugging Face 是 AI 界的“模型超市”,以后你会经常来。

Subsection 2 · 参数量(Parameters)是什么

  • 模型卡片上常写 7B、70B、405B——这就是参数量。
  • 参数,就是之前说的“那堆数字”,是模型在训练时学出来的“经验”。7B = 700 亿个数字。
  • 通俗理解:参数像人的“脑容量 + 阅历”。一般来说参数越多,模型越“见多识广”,回答质量越高,但也更贵、更慢、更难部署(后面学量化、部署时你会亲身体会)。
  • 同一个系列常有多个尺寸(如 Qwen-0.5B / 1.5B / 7B / 14B / 72B),这就是“从小到大”的版本。选型口诀:先小后大——开发调试用小模型省钱,最终效果不行再换大模型。
  • 过关自测:看到 7B 能说出“这是 700 亿参数”。能说出参数多的好处和代价。

Subsection 3 · 记下六大模型 在备忘录写一张表(照抄):

GPT      OpenAI    闭源  最知名,API 生态最成熟Claude   Anthropic 闭源  擅长长文本/代码/安全Gemini   Google    闭源  多模态强(文图视频音频)Llama    Meta      开源  可自部署/微调,生态最大Mistral  法国      开源+闭源  小而强,中文稍弱Grok     xAI       闭源  主打实时信息
  • 关键区分(必须记):闭源 = 只能调 API(方便、数据外发);开源 = 能下载权重自己部署/微调(私有化)。做产品先用闭源快速验证,做私有化/微调用开源。
  • 补充:所谓“下载权重”,下载的就是那堆参数(数字)。开源模型 = 厂商把这堆数字公开给你,你可以自己跑、自己改。闭源 = 这堆数字只存在厂商服务器上,你只能隔着网线调用。

Subsection 4 · 过关自测 ① 报出 6 个国外模型名字。② 说出“开源和闭源对你的区别”。③ 参数量是什么、多了有什么代价。 答得出 = Section 3 完成。


Section 4 · 注册平台、拿到 API Key(重点日)

本节成果 = 两个账号 + 一串 Key。Key 是你以后所有代码的“钥匙”。这一节是后面所有代码能跑起来的前提,请务必跟完。

Subsection 1 · 先搞懂:API Key 到底是个啥

  • 想象你家大门的钥匙:只有拿着钥匙的人才能进门。API Key 就是 AI 服务的“门禁卡”。
  • 你的程序要调用 DeepSeek 的模型,就得在请求里带上这张卡,AI 才知道“你是谁、扣谁的费、给你什么权限”。
  • 所以:Key 必须保密,像银行卡密码一样。 谁拿到你的 Key,就能花你的额度。
  • 常见坑:有人把 Key 直接写在代码里,又随手把代码传到 GitHub,结果 Key 被爬虫抓走,账户被刷爆。后面会教你把 Key 藏进 .env 文件,不提交到 Git。

Subsection 2 · API 调用到底发生了什么

  • 你在网页聊天框打字,和你在代码里调 API,其实是同一件事:把你的话发给模型所在的服务器,服务器跑一遍“切词 → 变向量 → 过网络 → 采样”,把生成的字逐段传回来。
  • 区别只在“包装”:网页帮你把请求封装好了;API 则是你自己用代码发请求,能拿到更细的控制(选模型、调温度、看用了多少 token)。
  • 看到 Usage / Tokens 别慌:token 是计费单位。你发进去的字 + 模型吐出来的字,都要按 token 计费。省 token = 省钱,后面会教你用技巧控制。
  • 过关自测:API 和网页聊天在实现上是不是一回事?计费单位是什么?

Subsection 3 · 注册 DeepSeek 开放平台

  • 打开 https://platform.deepseek.com/
  • 点右上角 “注册” → 填邮箱 + 设密码(或用手机号,更快)→ 收验证码填进去
  • 登录后进控制台
  • 预期看到:左侧一排菜单(Overview、API Keys、Usage、Balance)。
  • 验证码收不到:等 1 分钟点“重新发送”;查垃圾邮件箱;直接用手机号注册最快。
  • 提示实名认证:按提示操作,一般填身份证信息,几分钟过。这是国内平台合规要求,正常现象。

Subsection 4 · 创建你的第一个 API Key(重点)

  • 左侧点 “API Keys” → 点 “创建 API Key”
  • 名字随便填(如 mykey)→ 点确定
  • 弹出一个框,里面是一长串 sk- 开头的字符,这就是你的 Key。立刻复制,存进手机备忘录。
  • 这个 Key 只完整显示这一次!关掉就没了。 忘了存就:删掉这条 → 重新创建一条新的。
  • 预期看到:API Keys 列表多了一行(后面显示 sk-**** 打码是正常的)。
  • 建议:顺便在控制台看一眼“Usage”和“Balance”,确认有免费额度,心里有数。

Subsection 5 · 注册阿里通义千问平台

  • 打开 https://dashscope.aliyun.com/ → 手机号注册阿里云账号(有支付宝直接扫码最快)→ 登录进“模型广场”
  • 预期看到:一堆模型卡片(Qwen-Turbo、Qwen-Plus 等)。看一眼就行,不用懂。
  • 提示实名认证:按提示填身份证号,几分钟过。
  • 为什么让你注册两个:DeepSeek 开发好用、便宜;阿里 Qwen 是开源模型,后面学“私有化部署”时它最常用。两边都备好,后面不用临时补。

Subsection 6 · 收尾自检

  • 备忘录里存了那串 sk- 开头的 Key
  • DeepSeek 和阿里两个平台都能登录
  • 知道“开发用 DeepSeek、自部署用 Qwen”

提前避坑:要不要充钱?→ 都不用,两个平台都有免费额度。Key 别发群、别传 GitHub(后面教藏进 .env)。


Section 5 · Transformer:大模型的心脏(核心)

本节不下任何软件,只把“Transformer”这个让大模型爆发的架构讲明白。这是全教程最硬核也最值得的一节,听懂它,你就甩开 90% 只会“用”的人。

Subsection 1 · 为什么以前的模型不行

  • 在 Transformer 之前,处理文字主要靠 RNN(循环神经网络)。它的毛病是**“记性差”**:句子一长,前面的内容就忘了。好比复述一段很长的对话,说到最后你忘了开头。
  • 长文本能力差 → 翻译长句、写长文、读长文档都费劲。

Subsection 2 · 注意力机制 Attention:它到底在“注意”什么

  • Transformer 的绝活叫自注意力(Self-Attention)。直觉理解:
    • 当模型读到句子里的“它”时,它需要知道“它”指谁。自注意力就是让模型自己判断这句话里哪些词和当前这个词“关系最密切”,并给它们加权。
    • 比如 小明把苹果给了小红,因为她饿了 —— 读“她”时,模型会重点关注“小红”,而不是“苹果”或“小明”。
  • 核心三步(理解即可,不用背):
    1. 每个 token 的向量,通过三个小变换,变成 Q(Query,查询)、K(Key,键)、V(Value,值) 三份。
    2. 用 Q 和所有 K 做“点积相似度”,算出当前 token 对句中每个 token 的“关注度权重”。
    3. 用这些权重去加权求和所有 V,得到融合了上下文的新向量。
    • 生活化比喻:Q 像你在心里问“谁和这事有关?”,K 像每个人的“标签”,V 像每个人的“内容”,权重像“我该多看谁几眼”。
  • 关键好处:每个 token 都能“直接看到”整句话里所有 token,不存在“记性差”问题——这就是它能处理长文本的根本原因。
  • 过关自测:① 自注意力解决的是什么老问题?② 用比喻说出 Q/K/V 各是什么。

Subsection 3 · 为什么叫 Transformer

  • 论文标题《Attention Is All You Need》(2017,Google)。“Transformer”本意是“转换器”——它把一串 token 的向量,整串转换成另一串向量。
  • 它不 RNN 那样按顺序一个个读,而是整句并行处理 → 快、能上大规模并行 GPU → 这是它能“吃下整个互联网文本”的前提。
  • 记住:2017 年 Transformer 出现 → 2020 年代模型越练越大 → 2023 年 ChatGPT 爆火。 你现在用的所有大模型,其实都是这个架构的变体。

Subsection 4 · 层与多头:把“注意”重复很多次

  • 一个 Transformer 由很多“层”堆叠而成(常见 12~96 层)。每层都在做“注意力 + 一点数学变换”,层层提炼。
  • 每层里还有多头注意力(Multi-Head):不只有一个“注意机制”,而是多个头并行,各自关注不同侧面(有的看语法、有的看指代、有的看情感)。
  • 比喻:像一组编辑同时审稿——一个查错别字、一个查逻辑、一个查文风,最后汇总。层数越多、头越多,模型越“细致”,但参数和算力也越大。
  • 过关自测:Transformer 的“层”和“多头”大概是什么意思?能说出“堆叠 + 并行”两个词就算过。

Subsection 5 · 过关自测 ① Transformer 解决了什么老问题?② Attention 是什么?③ 为什么它能并行处理(对比 RNN)? 答得出 = Section 5 完成。这一站后半段会用到,站 11 还会深挖 Transformer 细节。


Section 6 · 预训练 + 微调,把大图串起来

本节,把前面零散的概念串成一张“大图”,并通过总验收。

Subsection 1 · 预训练 vs 微调 vs 推理 这三个词贯穿所有 AI 工作,必须分清:

  • 预训练(Pre-training):拿海量互联网文本,让模型“猜下一个字”,学出通用能力。成本极高(几千万美元、几千张显卡跑几个月),只有大厂做。你买不到、也不用做。
  • 微调(Fine-tuning):在预训练好的模型上,用你自己的少量数据再“补课”,让它擅长你的领域。成本低得多(几百到几千元就能做),是你要学的。
  • 推理(Inference):模型训练完,你调用它出结果的过程。推理不改模型,只是用模型。 你调 API、跑开源模型,都是在推理。
  • 比喻:预训练 = 读万卷书的“通才”;微调 = 去公司实习“转正”成专业人才;推理 = 请这位专业人才干活。三者成本递减,也对应你日后投入的层级。

Subsection 2 · 聊 10 个问题 打开 DeepSeek 网页版(https://chat.deepseek.com),各领域各问 2 个:科技、生活、代码、写作、学习。感受它什么都能答。

Subsection 3 · 再看一眼生态

  • https://huggingface.co/models → 按下载量(Downloads)排序 → 记下前 20 个里你认得出的模型名。
  • https://github.com/trending → 挑 1 个 AI 项目 → 点进去读 README 前 3 段(不要求懂,只看“这项目解决什么问题”)。

Subsection 4 · 理解“乐高积木”思想 在备忘录写(照抄,这是全教程最核心的思想):

大模型是块“预训练”好的万能积木,不用从零训练(成本天价)。 你只需要组合三件事: ① 写 Prompt —— 不动模型,靠指令引导(最轻) ② RAG —— 喂外部资料,让它回答你的私有知识(中等) ③ 微调 —— 改造模型本身(最重)

  • 用一个生活比喻理解:大模型像一个“读过万卷书的实习生”。Prompt 是你告诉他“这次怎么干活”;RAG 是塞给他“公司的内部资料”;微调是让他“真正转正、改变他的工作习惯”。三者由轻到重,成本也由低到高。
  • 补充:Prompt 只改“输入”;RAG 把“资料”拼进输入里一起喂;微调改的是“那堆参数”。所以前两者不碰模型本体,微调才动模型。

Subsection 5 · 认识大模型的四个“脾气” 用过的人都会遇到,提前知道不踩坑:

  • 幻觉(Hallucination):它会一本正经地编造不存在的知识。因为它本质是“猜下一个字”,不是查数据库。对策:重要事实要人工核对 / 用 RAG 喂真实资料。
  • 上下文窗口(Context Window):一次能“记住”的输入长度有限(如 8K / 32K / 128K token)。超过就“忘了前面”。对策:长文档要分块处理(RAG 那站教)。
  • 知识截止:训练数据有截止日期,新发生的事它不知道。对策:需要实时信息时,接搜索 / RAG。
  • 不是真的“懂”:它没有意识、没有立场,只是在做高明的模式匹配。对策:涉及专业判断(医疗、法律、财务)时,只能当参考,不能当最终结论。

Subsection 6 · 写 300 字 Part 1 总结 包括:① AI 1.0/2.0 区别 ② 开源 vs 闭源 ③ 你注册了哪些平台 ④ 用一句话说出“大模型本质是猜下一个字” ⑤ 你理解的 Attention 是什么。 写好后贴到你的学习记录里(网站留言/日志都可以),这是你的第一个“学习产出”。

Subsection 7 · 总验收勾选

  • 能讲清大模型为什么现在爆发(算力/数据/架构)
  • 能区分生成式 vs 判别式并举例
  • 能说出 6 个国外 + 5 个国产模型
  • 已注册 DeepSeek + 阿里 DashScope,有 API Key
  • 能说出“大模型的本质是预测下一个字”,并复述 Token→向量→网络→采样流程
  • 能用比喻解释 Attention(Q/K/V)和 Transformer 为什么能并行
  • 能分清预训练 / 微调 / 推理三者
  • 能说出大模型的四个“脾气”(幻觉/上下文/知识截止/非真懂)
  • Part 1 总结写完了

全勾选 = Part 1 通过,进入 Part 2 大模型原理。