🏠 回到博客首页
AI Learning · 课程目录
点击任意卡片进入讲义。每个讲义顶部有「← 上一课 / 目录 / 下一课 →」导航,可自由跳转复习。
📖 如何用 AI 这样学(方法论 · 想复制这套学习方式先看这个)→
主线:Token → Embedding → Vector(点积) → softmax → 朴素注意力 → Q/K/V → 缩放点积 →〔Multi-head…〕
Module 0 · Foundations
✅
01·02
Token & Embedding
token=座位号(index),embedding=查表取的多维向量;意义在向量的空间位置。含 FAQ:编号任意性、两种训练、tokenizer 锁死/重训。
✅
03
Vector · 点积与相似度
点积=对应位相乘求和=衡量两向量"有多对齐";方向 vs 长度;余弦。
Module 1 · Transformer(Self-Attention 微课链)
✅
04
softmax
分数→(e^x 指数化 + ÷总和 归一化)→和为1的权重。含 y=e^x 曲线、为何负数不能直接÷总和、为何要和为1。
✅
05
朴素注意力
只用点积+softmax+加权和,建立"按相似度混合上下文"的核心直觉(还没 Q/K/V)。
✅
06
Query / Key / Value
三台矩阵把 x 投影成 找/被找/给 三角色;修朴素版的对称与"最爱自己"。含 FAQ:q/k/v vs x、为何不预存。
✅
07
缩放点积 ÷√d
维度高→分数大→softmax 饱和;÷√d 把落点拉回平缓区。完整公式 softmax(QKᵀ/√d)V。
✅
08
Multi-head Attention
单头只能关注一种关系;多头并行开 h 套注意力各看一种。512→拆 h 个 64→拼回 512→W_O。注意力通关。
✅
09
残差连接 Residual
output = x + Layer(x):加一条捷径让层只学"增量"。梯度高速路 / 易学恒等 / 逐层微调 → 能堆几十层。
✅
10
LayerNorm
把每个词向量减均值除标准差→均值0标准差1,再 γ/β 可调。稳住数值防漂移。和残差合称 Add & Norm。
✅
11
FFN(前馈网络)
两层+中间非线性:512→放大2048→激活→缩回512。逐词独立深加工。注意力=交流,FFN=计算。约占2/3参数。
Module 2 · Large Language Models(LLM 如何生成文字)
✅
12
Module 2 概览(自顶向下地图)
先看清整条生成链路骨架:hidden state→输出层→softmax→采样→下一个词→循环。关键新观念:生成是自回归循环。
✅
13
自回归 & 因果掩码
每个位置预测"它的下一个词",因果掩码=只能看左边(不作弊)。训练用全部位置,生成只读最后一个。
✅
14
输出层 / Unembedding
最后位置 hidden state × W_U → 整个词表的 logits → softmax 概率。每列是一个候选 token 的匹配方向;常见 weight tying。
✅
15
Greedy 与 Sampling
概率如何变成离散 token id:greedy 永远选第一名;sampling 把概率变成区间、用随机数抽签。稳定 vs 多样。
✅
16
Temperature
采样前调节概率分布的尖锐程度:低温保守集中,高温开放分散。含交互滑块;不改变候选排名。
补充 & 复习
总复习
Module 1 总复习(图 + 挖空自测)⭐
整张心智模型图 + 一键挖空自测 + 引导复述提纲。对着马赛克版复述整条链路 = 真学会。学完 Module 1 必做。
补充 A
矩阵作为"变换"
矩阵=加工机(变换)、向量=料;同一个 x 经 W_Q/W_K 得到不同方向 → 打分不对称的数学根源。含 X·W=Q 形状图。
补充 B
梯度(直觉预告)
梯度=往哪调参数能降低误差;训练 4 步循环;为何各头梯度不同→自发分化。完整版在 Module 4。
补充 C
3D 梯度下降(可旋转 · Plotly)
交互式 3D loss 曲面 + 下降路径,鼠标可旋转。用真正的 3D 看"小球滚到谷底"。需联网(Plotly CDN)。
补充 D
术语表 & 三段心智分层
配置/编译时/运行时三段;参数 vs 超参数;token/词向量/hidden state 等名词对照。名词混了随时来查。
总览
注意力全链(复习锚点)
一张图:q·k → ÷√d → softmax → 加权和 v,每步对应哪一课。断片时先看这张。
总览
全局数据流(大地图)
字符串→tokenize→embedding→N层Block→输出层→下一个词。标注每环学到没有;看清"现在在哪、还差什么"。