公司动态
Transformer 论文精读路线:从 Attention 到现代 LLM 架构
Transformer 论文精读路线从 Attention 到现代 LLM 架构系列AI 论文精读与复现训练营日期2026-08-01适合读者研究生、准备进入 LLM 方向的科研新人、有深度学习工程背景但想系统读架构论文的读者建议前置理解矩阵乘法、softmax、残差连接、LayerNorm、语言模型训练目标目录为什么 Transformer 路线值得精读核心阅读方法先找不变量再找改动点代表论文路线图关键论文精读方法与实验对比表复现建议常见误区适合研究生继续做的选题总结参考资料为什么这个主题重要很多同学第一次读 Transformer会把注意力公式、encoder-decoder 图和 BLEU 分数当成重点。但现代 LLM 的论文已经很少停留在“是否使用 Transformer”这个层面它们默认读者知道基本 block然后在局部做选择用 pre-norm 还是 post-norm用 LayerNorm、RMSNorm 还是额外 normalization位置编码用绝对位置、相对位置还是 RoPE注意力头是否共享 KVFFN 是否使用 gated activationdense FFN 是否换成 MoE长上下文靠架构、训练数据、位置外推还是 serving 系统因此Transformer 路线的真正价值是建立一套架构阅读坐标系。你以后读任何 LLM 技术报告都可以把它拆成五层token 与位置、attention、FFN/MoE、normalization/residual、训练目标与上下文长度。论文里的模型名会变但这五层会反复出现。核心阅读方法先找不变量再找改动点读 Transformer 架构论文时不建议从 benchmark 表格开始。先画一个最小 block输入 token embedding 加上位置信息。attention 子层混合序列内的信息。FFN 子层对每个位置做非线性变换。residual connection 保留梯度与原始表示。normalization 控制训练稳定性。decoder-only 模型还要考虑 causal mask 与 KV cache。然后对每篇论文做“改动点标注”改 attention可能是 multi-head、multi-query、grouped-query、latent attention、sparse/block attention、FlashAttention 这类系统友好实现。改 position可能是 sinusoidal、learned absolute、relative position、RoPE、长上下文外推。改 FFN可能是 ReLU/GELU 到 GEGLU/SwiGLU也可能是 dense FFN 到 MoE。改 norm/residual可能是 post-norm 到 pre-norm、RMSNorm、额外 normalization 或 residual scaling。改 objective可能是 masked LM、causal LM、span corruption、text-to-text、multi-token prediction。改 scale可能是参数、数据、上下文长度、激活参数、训练精度和硬件效率的共同设计。这样读的好处是你不会把“模型更大”“数据更多”“调参更好”误读成“架构必然更优”。架构论文的证据强度取决于它是否把改动点从训练配方、数据质量和推理系统中分离出来。代表论文路线图第一站原始 Transformer。Vaswani 等人在 2017 年提交的Attention Is All You Need提出完全基于注意力的 encoder-decoder 架构去掉 recurrent 和 convolutional 结构并用 multi-head attention、position-wise FFN、residual、normalization 和 positional encoding 组成可并行训练的序列转导模型。精读时不要只背公式要重点看作者如何把序列建模问题拆成“token-to-token 信息路由”和“位置无关的逐点变换”。第二站预训练目标分叉。BERT 选择 encoder-only 和 masked language modeling强调双向表示GPT 系列选择 decoder-only 和 causal language modeling强调自回归生成T5 把 NLP 任务统一为 text-to-text并系统比较预训练目标、数据、架构和迁移策略。这里要读懂同样基于 Transformer为什么输入可见性、mask 方式和 fine-tuning 形式会塑造模型能力。第三站规模化 decoder-only。GPT-3、PaLM、LLaMA 把研究重点转向“如何把 decoder-only LM 训练到足够大且可用”。GPT-3 证明 few-shot prompting 与规模强相关PaLM 报告 540B dense Transformer 及 Pathways 系统训练LLaMA 证明在公开数据与更充分 token 预算下中小参数量模型也能有强表现。读这一段时要把 architecture、data、compute 三者一起看。第四站现代 block 的局部替换。RoPE 影响了位置编码的主流选择RMSNorm 降低归一化开销并被多种 LLM 采用GLU/SwiGLU 改写 FFN 的非线性部分MQA/GQA 直接面向自回归推理中的 KV cache 带宽瓶颈FlashAttention 系列说明很多“架构可用性”实际依赖 GPU memory hierarchy 和 kernel 实现。第五站2025 前后的系统级架构。DeepSeek-V3 使用 MoE、Multi-head Latent Attention、auxiliary-loss-free load balancing 和 multi-token predictionQwen3 同时发布 dense 与 MoE 尺寸并强调 thinking / non-thinking 模式和长上下文支持Llama 4 模型卡说明其使用 MoE 与 early fusion 多模态架构。现代技术报告往往不是单一创新而是 architecture、training、data、post-training、serving 的组合包。关键论文精读1. Attention Is All You Need读结构不只读公式这篇论文最重要的贡献不是 softmax(QK^T / sqrt(d_k)) 这个公式本身而是把序列建模从时间步递归中解放出来。你要重点读三处Multi-head attention 为什么要分头它让模型在不同表示子空间中学习不同关系而不是把所有关系压进一个注意力矩阵。Encoder-decoder attention 为什么存在它把源序列表示作为 memory让 decoder 在生成时查询。Positional encoding 为什么必要纯注意力本身对 token 顺序不敏感必须注入顺序信息。精读动作把论文图 1 重画成你自己的 block并标注每个张量的形状。然后尝试解释为什么 self-attention 的计算复杂度与序列长度平方相关这会为后续长上下文论文打地基。2. BERT、T5 与 GPT-3架构相似目标不同BERT 的关键是 bidirectional encoder 表示适合做理解任务的 fine-tuningT5 的关键是把任务统一成 text-to-text从而能系统研究预训练目标GPT-3 的关键是把 decoder-only causal LM 推向大规模 few-shot setting。三者都不是“谁替代谁”而是展示了 Transformer 在不同可见性约束下的分工。读这组论文时建议做一个三列表输入能看见什么、训练时预测什么、推理时怎么使用。BERT 的 masked token 预测和 GPT 的 next-token prediction 对梯度信号、数据构造和能力外显方式都有影响。T5 适合作为方法论样本因为它系统比较多个变量而不是只发布一个更大的模型。3. RoPE、RMSNorm、SwiGLU现代 LLM block 的“三个小改动”很多 LLM 架构看起来只是 Transformer 的变体但它们的 block 已经和 2017 版本不同。RoPE 把位置信息编码进 query/key 的旋转关系适合与 attention 分数结合RMSNorm 去掉 LayerNorm 的 re-centering仅保留 RMS 级别的缩放归一化SwiGLU/GEGLU 这类 gated FFN 让前馈层不仅是“线性-激活-线性”而是带门控的信息筛选。这类论文的读法不是问“提升多少分”而是问改动是否局部、是否容易插入已有 block、计算开销如何、是否在多个规模上稳定。研究生做复现时可以选 100M 到 1B 级别的小模型比较 ReLU/GELU/SwiGLU、LayerNorm/RMSNorm、absolute/RoPE 的训练 loss 曲线和下游小任务而不必复现大模型分数。4. MQA、GQA、FlashAttention从训练架构读到推理瓶颈自回归生成不是一次性并行输出而是逐 token 解码。每生成一个 token模型都要读历史 token 的 key/value cache。Multi-query attention 让多个 query head 共享一组 key/value降低 KV cache 读写压力grouped-query attention 在 MHA 与 MQA 之间折中用多个 KV 组保留质量FlashAttention 则不是改变数学定义而是改变 attention 的 GPU 计算与 memory access 方式。这一组论文训练你区分“数学架构”和“系统实现”。有些方法不改变模型函数却显著改变可训练长度、吞吐和显存占用。读实验表时不要只看 perplexity也要看 throughput、memory、context length、硬件型号和 kernel 支持。5. DeepSeek-V3、Qwen3、Llama 4现代技术报告怎么拆DeepSeek-V3 报告称模型为 671B total、37B activated 的 MoE使用 MLA 和 DeepSeekMoE并加入 auxiliary-loss-free load balancing 与 multi-token prediction。Qwen3 官方仓库显示其发布 dense 与 MoE 多尺寸模型包括 30B-A3B、235B-A22B 等并在 2025 年更新了长上下文与 thinking/non-thinking 形态。Meta Llama 4 模型卡写明 Scout 与 Maverick 是 auto-regressive、MoE、early-fusion multimodal 模型发布时间为 2025-04-05。读这些报告时要更克制不要把开放模型的 benchmark 表直接当作架构结论。它们通常同时改了数据、tokenizer、训练配方、RL/post-training、serving kernel 和评测集合。正确做法是把报告拆成“架构声明”“训练声明”“数据声明”“评测声明”“限制声明”并为每条声明找可复现证据。方法与实验对比表论文/资料重点读什么架构改动位置复现最小实验主要风险Attention Is All You Needmulti-head attention、encoder-decoder、positional encodingattention 与整体 block小型机器翻译或复制任务重画张量形状只背公式不理解并行化动机BERTmasked LM 与双向 encoderobjective encoder-only小语料 MLM 预训练 分类微调把理解任务结论泛化到生成模型T5text-to-text 统一框架与消融objective transfer setup用同一模型格式跑分类/摘要小任务忽略数据清洗和任务模板GPT-3decoder-only few-shot scalingscale prompting interface小 decoder LM 的 in-context 学习探针把规模效应误判为单一架构创新RoPE / RMSNorm / SwiGLU局部 block 替换position、norm、FFN同规模小模型训练曲线对比只看最终分数不看稳定性MQA / GQA / FlashAttentionKV cache、吞吐、显存attention 与 kernel固定模型比较 prefill/decode latency混淆算法复杂度和实际硬件效率DeepSeek-V3 / Qwen3 / Llama 4MoE、长上下文、多模态/推理形态system-level architecture复现子模块或配置解析不复现全量训练把技术报告当成单变量实验复现建议如果你是研究生不建议从“复现 Llama 级别模型”开始。更合理的路线是做三个小实验。实验一重建最小 Transformer。用 PyTorch 写一个 decoder-only LM在 TinyStories、WikiText-2 或自建小语料上训练。目标不是高分而是验证 mask、residual、norm、FFN、position 的实现是否正确。必须保存 config、seed、loss 曲线和样例生成。实验二局部替换消融。在同一训练预算下比较两到三个改动absolute position vs RoPELayerNorm vs RMSNormGELU FFN vs SwiGLU FFNMHA vs GQA。每次只改一个变量。报告里写明参数量是否变化、训练 token 是否一致、学习率是否重新调过。实验三推理侧测量。固定一个开源小模型测 prefill latency、decode latency、显存、KV cache 大小比较不同上下文长度。这里不要追求论文级 benchmark而要训练自己理解“为什么现代架构论文总在谈 KV cache、GQA、FlashAttention、serving engine”。复现记录至少包括代码 commit 或压缩包 hash。Python、PyTorch、CUDA、transformers/vLLM/llama.cpp 版本。数据集名称、版本、清洗规则和样本数。模型 config层数、hidden size、head 数、KV head 数、FFN hidden size、position type、norm type。训练预算token 数、batch size、学习率、warmup、precision。日志loss、吞吐、显存峰值、异常样例。负结果不稳定、loss spike、OOM、速度反常都要写。常见误区误区一把 Transformer 等同于 attention。Attention 是核心但现代 LLM 的表现还依赖 FFN 容量、normalization、位置编码、训练目标、数据和规模。只读 attention 公式无法读懂 LLM 技术报告。误区二把 decoder-only 当成“更高级”。Encoder-only、encoder-decoder、decoder-only 是任务和训练目标选择不是线性进化。BERT 仍然适合表示学习T5 仍然适合统一任务建模decoder-only 只是现代通用生成模型的主流选择。误区三看到 MoE 就认为计算一定便宜。MoE 降低每 token 激活参数但会引入 routing、负载均衡、通信和部署复杂度。论文里的 total params、activated params、专家数、top-k、共享专家都要分开记录。误区四忽略硬件和 kernel。长上下文 attention 是否可用常常取决于 FlashAttention、paged KV cache、tensor parallel、GPU memory bandwidth 和 batch scheduling。架构读不懂系统复现就容易失败。误区五复制 benchmark 表格当结论。技术报告的评测表通常混合了模型、数据、后训练、提示格式和评测实现。科研训练要追求“能解释的差异”不是堆排名。适合研究生继续做的选题小模型上的 position encoding 外推研究固定 100M 到 300M decoder-only 模型比较 RoPE、ALiBi、RoPE scaling 在短训长测下的稳定性。GQA 的质量-速度折中曲线固定参数量和训练数据系统改变 KV head 数测 perplexity、decode latency 和显存。FFN 门控对推理任务的影响比较 GELU、GEGLU、SwiGLU 在数学、代码、小语料语言建模上的差异重点分析训练稳定性。MoE routing 可解释性小实验在小型 MoE LM 上观察不同 token 类型、语言或任务是否倾向不同 expert。技术报告声明核验工具写脚本解析 Hugging Face config、model card 和论文表格自动生成“架构声明清单”标出待人工核验字段。训练目标与架构交互比较同一 Transformer block 在 causal LM、span corruption、prefix LM 下的表示和生成差异。总结Transformer 精读路线的核心不是“读完一篇神作”而是建立一个能持续复用的架构坐标系。先读 2017 年原始 Transformer理解 attention、FFN、position、residual、norm 的基本分工再读 BERT、T5、GPT-3理解训练目标如何改变模型用途然后读 RoPE、RMSNorm、SwiGLU、MQA/GQA、FlashAttention理解现代 block 的局部演化最后读 DeepSeek-V3、Qwen3、Llama 4 这类技术报告训练自己把系统级模型拆回可检验的研究问题。真正的科研训练发生在复现和消融里你能否固定变量、重跑小实验、解释负结果并从一个局部改动提出下一步问题。能做到这一点Transformer 就不再是一张经典架构图而会变成你进入 LLM 研究的工具箱。参考资料检索日期2026-08-01。以下优先列出论文、官方项目页、官方模型卡或会议页面模型卡、仓库 release、benchmark 数字等易变化信息投稿或发布前建议再次核验。Vaswani et al., 2017,Attention Is All You Need, arXiv: https://arxiv.org/abs/1706.03762Devlin et al., 2018/2019,BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, arXiv: https://arxiv.org/abs/1810.04805Raffel et al., 2019/2023,Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer, arXiv: https://arxiv.org/abs/1910.10683Brown et al., 2020,Language Models are Few-Shot Learners, NeurIPS: https://papers.neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.htmlKaplan et al., 2020,Scaling Laws for Neural Language Models, arXiv: https://arxiv.org/abs/2001.08361Shazeer, 2020,GLU Variants Improve Transformer, arXiv: https://arxiv.org/abs/2002.05202Zhang and Sennrich, 2019,Root Mean Square Layer Normalization, NeurIPS: https://papers.nips.cc/paper_files/paper/2019/hash/1e8a19426224ca89e83cef47f1e7f53b-Abstract.htmlSu et al., 2021,RoFormer: Enhanced Transformer with Rotary Position Embedding, arXiv: https://arxiv.org/abs/2104.09864Shazeer, 2019,Fast Transformer Decoding: One Write-Head is All You Need, arXiv: https://arxiv.org/abs/1911.02150Ainslie et al., 2023,GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, ACL Anthology / EMNLP 2023: https://aclanthology.org/2023.emnlp-main.298/Dao, 2023,FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning, arXiv: https://arxiv.org/abs/2307.08691Chowdhery et al., 2022,PaLM: Scaling Language Modeling with Pathways, arXiv: https://arxiv.org/abs/2204.02311Touvron et al., 2023,LLaMA: Open and Efficient Foundation Language Models, arXiv: https://arxiv.org/abs/2302.13971Grattafiori et al., 2024,The Llama 3 Herd of Models, arXiv: https://arxiv.org/abs/2407.21783DeepSeek-AI, 2024/2025,DeepSeek-V3 Technical Report, arXiv: https://arxiv.org/abs/2412.19437Qwen Team, 2025, Qwen3 official repository and technical report links: https://github.com/QwenLM/Qwen3Qwen Team, 2025,Qwen3: Think Deeper, Act Faster, official blog: https://qwenlm.github.io/blog/qwen3/Meta, 2025, Llama 4 model card: https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.mdMeta, 2025,The Llama 4 herd, official blog: https://ai.meta.com/blog/llama-4-multimodal-intelligence/