AI Learning · 课程目录
点击任意卡片进入讲义。每个讲义顶部有「← 上一课 / 目录 / 下一课 →」导航,可自由跳转复习。
主线:Token → Embedding → Vector(点积) → softmax → 朴素注意力 → Q/K/V → 缩放点积 →〔Multi-head…〕
Module 0 · Foundations
✅
01·02
Token & Embedding
token=座位号(index),embedding=查表取的多维向量;意义在向量的空间位置。含 FAQ:编号任意性、两种训练、tokenizer 锁死/重训。
✅
03
Vector · 点积与相似度
点积=对应位相乘求和=衡量两向量"有多对齐";方向 vs 长度;余弦。
Module 1 · Transformer(Self-Attention 微课链)
✅
04
softmax
分数→(e^x 指数化 + ÷总和 归一化)→和为1的权重。含 y=e^x 曲线、为何负数不能直接÷总和、为何要和为1。
✅
05
朴素注意力
只用点积+softmax+加权和,建立"按相似度混合上下文"的核心直觉(还没 Q/K/V)。
✅
06
Query / Key / Value
三台矩阵把 x 投影成 找/被找/给 三角色;修朴素版的对称与"最爱自己"。含 FAQ:q/k/v vs x、为何不预存。
✅
07
缩放点积 ÷√d
维度高→分数大→softmax 饱和;÷√d 把落点拉回平缓区。完整公式 softmax(QKᵀ/√d)V。
补充 & 复习
补充 A
矩阵作为"变换"
矩阵=加工机(变换)、向量=料;同一个 x 经 W_Q/W_K 得到不同方向 → 打分不对称的数学根源。
总览
注意力全链(复习锚点)
一张图:q·k → ÷√d → softmax → 加权和 v,每步对应哪一课。断片时先看这张。