Module 1 · Transformer 总览 复习锚点

注意力全链

把学过的 5 节课拼成一条流水线。处理词 i 时,它如何吸收上下文——一张图看全。

Attention(Q,K,V) = softmax( Q·Kᵀ / √d ) · V

① 四步流水线

处理词 i:对句中每个词 j 走这四步 每个词 x → 投影 q=xW_Q k=xW_K v=xW_V Q/K/V 课 ① 打分(点积) s_j = q_i · k_j 点积课 · "有多相关" ② 缩放 s_j = s_j / √d 缩放点积课 · 防饱和 ③ softmax w_j = e^(s_j) / Σ e^(s) softmax 课 · 变成和=1 的权重 ④ 加权求和 new_i = Σ w_j · v_j 朴素注意力课 · 混合 value 词 i 的新向量 "吸收了上下文" 每个词都走一遍这条链,各自得到自己的新向量
①点积打分 → ②÷√d 缩放 → ③softmax 成权重 → ④加权求和 value。这就是 softmax(QKᵀ/√d)V。

② 每一步 = 哪一课

投影 q/k/vQ/K/V 课 —— 三台矩阵把 x 加工成"找/被找/给"三个角色
① 打分 q·k点积课 —— 点积衡量两向量"有多对齐/相关"
② 缩放 /√d缩放点积课 —— 维度高→分数大→softmax 饱和;除掉拉回平缓区
③ softmaxsoftmax 课 —— e 的幂 ÷ 总和 → 和为 1 的权重
④ 加权求和朴素注意力课 —— 按权重混合各词的 value

③ 一句话记忆

q·k 测相关 → ÷√d 稳一稳 → softmax 变权重 → 乘 v 求平均

softmax 的算法一直没变(e 的幂÷总和);变的只是喂给它的分数 = 真实的 q·k/√d。