king-of-water · 个人博客
你好,我是
king-of-water。
这里记录后端、Agent 实践、项目,以及真正用过的工具。
栏目
从一个方向开始最近更新
全部文章 →现代 LLM 的 Transformer:从 Token 输入到下一个 Token
从一条具体的请求出发,逐层拆解现代 Decoder-only Transformer 的每个组件:Embedding、RoPE 位置编码、RMSNorm、GQA 注意力、SwiGLU 前馈层、残差连接,以及 logits 到采样的完整流程。解释每个设计决策相比原始 Transformer 改了什么、为什么改。
《Attention Is All You Need》精读:Transformer 解决了什么
2017 年这篇论文为什么重要?从序列建模的历史困境出发,逐步拆解 Transformer 的每个设计决策——为什么抛弃 RNN、Self-Attention 的计算逻辑、Multi-Head 的作用、位置编码的必要性——以及这些决策为后来的 GPT 和 BERT 路线奠定了什么基础。
推理优化:Continuous Batching、量化与投机解码
从"为什么 GPU 在推理时经常空转"出发,拆解三类推理优化技术:Continuous Batching 让 GPU 不浪费等待,量化(INT8/INT4/GPTQ/AWQ)缩小模型降低带宽压力,投机解码用小模型草稿加速大模型验证。这些优化合起来能让推理吞吐量提升 10-30 倍。
LLM 预训练:数据、目标函数与 Scaling Law
从"为什么预测下一个 Token 能学会推理"出发,解释预训练的目标函数、数据配比与质量对模型能力的决定性影响,以及 Scaling Law 如何让研究者在训练前就能估算模型的最终表现。
LLM 后训练:SFT、RLHF、DPO 与 GRPO
预训练模型能预测下一个 Token,但它不会对话、不会拒绝有害请求、也不会一步步推理。后训练就是把这些能力装进去的阶段。从 SFT 的示范学习,到 RLHF 的奖励模型,再到 DPO 省掉强化学习的做法,以及 DeepSeek-R1 用 GRPO 训出推理能力的路径。
大模型微调:Full Fine-tuning、LoRA 与 QLoRA
从"为什么不直接更新全部参数"出发,拆解 LoRA 用低秩矩阵逼近权重更新的原理,解释 rank、alpha、target modules 这些参数在实际训练中意味着什么,以及 QLoRA 怎样把 70B 模型的微调显存压进一块 GPU。