数学补充 Supplement B 🅿️ 完整版在 Module 4

梯度(直觉预告)

为了解释"多头为什么会自发分化"顺带引出。这里只建直觉;完整的 loss / 反向传播 / 梯度下降在 Module 4 (Training) 系统讲。

⚠️ 这是预告,不是正课。目标只有一个:让你对"训练怎么调参数、为什么每个参数调得不一样"有个感觉。看完够用即可,不必深究细节。

① 梯度是什么(一句话)

梯度 = "把某个参数(某个 W 里的一个数)往上微调一点点,预测误差会变大还是变小、变化多快"。 就是误差对这个参数的"斜率 / 敏感度"。

梯度为正调大这个数 → 误差变大 → 那就该调小
梯度为负调大这个数 → 误差变小 → 那就该调大
梯度大/小大 → 影响大,调整幅度大;小 → 只需微调

② 梯度在哪里体现:训练的 4 步循环

  1. 前向:输入 → 一路算到输出 → 预测下一个词
  2. 算误差:预测 vs 正确答案 → 一个数 loss(有多错)
  3. 反向:从 loss 倒推,给每一个参数各算一个梯度 ← 梯度在这里产生
  4. 更新参数 = 旧值 − 学习率 × 它的梯度 ← 梯度在这里被用掉

亿万次这个循环,参数被慢慢雕刻成有用的样子。第 ③ 步(反向传播)会对模型里每一个数(包括 8 组 W_Q/K/V 里的每个元素)都算出一个专属梯度。

③ 几何直觉:下山

loss 地形(一个参数的切面) 参数值 loss 现在 梯度指示的下坡方向 误差最低
把 loss 想成丘陵,每个参数是一个坐标轴。梯度 = 脚下的坡度,告诉这个参数"往哪边是下坡"。梯度下降 = 所有参数各自朝下坡挪一小步。

④ 为什么每个参数(每个头)的梯度不同

同一个 loss 倒推时,每个参数分到的梯度取决于:它当前的值 + 它在网络里的位置 + 流经它的数据

head 1 的 W_Q 和 head 2 的 W_Q:值不同(随机初始化起点不同)、路径不同 → 倒推给它们的梯度不同 → 每步往不同方向走 → 越走越分化

接回多头:"独立权重"= 8 组各自的 (W_Q,W_K,W_V)。训练前随机初始化(起点不同),训练中各自被不同梯度推动(终点不同),而"降低误差"的压力奖励分工 → 8 个头自发学到不同关注模式。
🅿️ 后面才展开:loss 具体怎么定义、反向传播怎么把梯度一层层倒推、学习率怎么选、各种优化器——这些都在 Module 4 (Training)。今天只需记住"梯度 = 往哪调能降低误差,在反向传播算、在更新用"。