Module 1 · Transformer 总览 全局地图

全局数据流:字符串 → 下一个词

一张图看清整条管道,以及"我们现在学到哪、还差什么"。到目前为止,我们只做了"向量 → 更好的向量"的加工,还没产出任何能读的输出。

① 完整管道(含进度标注)

字符串 "The cat sat" 原始输入 ① Tokenize → N 个整数 [1917, 995, …] ✅ 已学 ② Embedding(查表) → [N × d_model] 向量 ✅ 已学 ③ N 层 Transformer Block(叠 N 次) Multi-head 注意力 ✅ 已学(含 Q/K/V·softmax·÷√d·多头) 残差 + LayerNorm + FFN 🅿️ 下一课(Module 1 收尾) 每层: 向量→ 更好的 向量 [N × d_model] 向量(更懂上下文) ⬅ 我们现在到这里:还是向量,不是词! ④ 输出层(unembedding) 取最后一个词的向量 → 词表概率 🅿️ Module 2 下一个词 "on"
绿=已学,黄=待学。到"更懂上下文的向量"为止都是向量加工;变成能读的下一个词要靠 ④ 输出层(Module 2)。

② 现在的位置

字符串
  → tokenize ✅ → N 个整数
  → embedding ✅ → [N × d_model] 向量
  → Multi-head 注意力 ✅ + 残差/LN/FFN 🅿️,叠 N 层 → [N × d_model] 向量(更懂上下文) ⬅ 现在在这
  → 输出层 🅿️ (Module 2) → 词表概率 → 采样 → 下一个词

③ 各环节状态

环节做什么状态
Tokenize文本 → N 个整数 id✅ 已学
Embedding查表 → [N × d_model] 向量✅ 已学
Multi-head 注意力每个词吸收上下文(Q/K/V·softmax·÷√d·多头)✅ 已学
残差 / LayerNorm / FFNBlock 的其余零件,稳训练 + 增强表达🅿️ 下一课
多层堆叠把 Block 叠 N 层,逐层精炼🅿️ Module 1 收尾
输出层 (unembedding)最后一个词的向量 → 词表概率 → 采样下一个词🅿️ Module 2

关键提醒:Transformer 主干自始至终在做"向量 → 更好的向量",不直接吐词。要得到能读的"下一个词",必须靠最后的输出层把向量翻译回词表概率。预测时只用最后一个位置的向量(因为要接在整句后面预测下一个)。