AI Learning · 课程目录

点击任意卡片进入讲义。每个讲义顶部有「← 上一课 / 目录 / 下一课 →」导航,可自由跳转复习。

主线:Token → Embedding → Vector(点积) → softmax → 朴素注意力 → Q/K/V → 缩放点积 →〔Multi-head…〕

Module 0 · Foundations

01·02Token & Embedding
token=座位号(index),embedding=查表取的多维向量;意义在向量的空间位置。含 FAQ:编号任意性、两种训练、tokenizer 锁死/重训。
03Vector · 点积与相似度
点积=对应位相乘求和=衡量两向量"有多对齐";方向 vs 长度;余弦。

Module 1 · Transformer(Self-Attention 微课链)

04softmax
分数→(e^x 指数化 + ÷总和 归一化)→和为1的权重。含 y=e^x 曲线、为何负数不能直接÷总和、为何要和为1。
05朴素注意力
只用点积+softmax+加权和,建立"按相似度混合上下文"的核心直觉(还没 Q/K/V)。
06Query / Key / Value
三台矩阵把 x 投影成 找/被找/给 三角色;修朴素版的对称与"最爱自己"。含 FAQ:q/k/v vs x、为何不预存。
07缩放点积 ÷√d
维度高→分数大→softmax 饱和;÷√d 把落点拉回平缓区。完整公式 softmax(QKᵀ/√d)V。

补充 & 复习

补充 A矩阵作为"变换"
矩阵=加工机(变换)、向量=料;同一个 x 经 W_Q/W_K 得到不同方向 → 打分不对称的数学根源。
总览注意力全链(复习锚点)
一张图:q·k → ÷√d → softmax → 加权和 v,每步对应哪一课。断片时先看这张。