king-of-water · 个人博客

你好,我是
king-of-water。

这里记录后端、Agent 实践、项目,以及真正用过的工具。

现代 LLM 的 Transformer:从 Token 输入到下一个 Token

从一条具体的请求出发,逐层拆解现代 Decoder-only Transformer 的每个组件:Embedding、RoPE 位置编码、RMSNorm、GQA 注意力、SwiGLU 前馈层、残差连接,以及 logits 到采样的完整流程。解释每个设计决策相比原始 Transformer 改了什么、为什么改。

LLMTransformerDecoderRoPERMSNormGQASwiGLU采样推理

《Attention Is All You Need》精读:Transformer 解决了什么

2017 年这篇论文为什么重要?从序列建模的历史困境出发,逐步拆解 Transformer 的每个设计决策——为什么抛弃 RNN、Self-Attention 的计算逻辑、Multi-Head 的作用、位置编码的必要性——以及这些决策为后来的 GPT 和 BERT 路线奠定了什么基础。

LLMTransformerAttentionSelf-Attention论文精读RNN序列建模

推理优化:Continuous Batching、量化与投机解码

从"为什么 GPU 在推理时经常空转"出发,拆解三类推理优化技术:Continuous Batching 让 GPU 不浪费等待,量化(INT8/INT4/GPTQ/AWQ)缩小模型降低带宽压力,投机解码用小模型草稿加速大模型验证。这些优化合起来能让推理吞吐量提升 10-30 倍。

LLM推理优化Continuous Batching量化投机解码vLLMPagedAttention吞吐量

LLM 预训练:数据、目标函数与 Scaling Law

从"为什么预测下一个 Token 能学会推理"出发,解释预训练的目标函数、数据配比与质量对模型能力的决定性影响,以及 Scaling Law 如何让研究者在训练前就能估算模型的最终表现。

LLM预训练Scaling Law训练数据目标函数Transformer语言模型

LLM 后训练:SFT、RLHF、DPO 与 GRPO

预训练模型能预测下一个 Token,但它不会对话、不会拒绝有害请求、也不会一步步推理。后训练就是把这些能力装进去的阶段。从 SFT 的示范学习,到 RLHF 的奖励模型,再到 DPO 省掉强化学习的做法,以及 DeepSeek-R1 用 GRPO 训出推理能力的路径。

LLM后训练SFTRLHFDPOGRPO强化学习偏好对齐

大模型微调:Full Fine-tuning、LoRA 与 QLoRA

从"为什么不直接更新全部参数"出发,拆解 LoRA 用低秩矩阵逼近权重更新的原理,解释 rank、alpha、target modules 这些参数在实际训练中意味着什么,以及 QLoRA 怎样把 70B 模型的微调显存压进一块 GPU。

LLMLoRAQLoRA微调Fine-tuningPEFT参数高效微调