LLM 原理与训练

从零理解 Token、Transformer、训练、后训练与推理。

大模型通识:从 Token、Transformer 到训练与推理

面向没有大模型算法基础的工程师,用一条完整运行链解释 Token、向量、Attention、Transformer、预训练、微调、后训练、推理、KV Cache,以及 Prompt、RAG 与模型参数各自改变了什么。

LLMTransformerAttentionTokenPretrainingPost-trainingKV Cache
  1. 《Attention Is All You Need》精读:Transformer 解决了什么待深入
  2. 现代 LLM 的 Transformer:从 Token 输入到下一个 Token待深入
  3. Tokenization:模型看到的文字为什么和人不一样待深入
  4. KV Cache:大模型生成为什么越来越占显存待深入
  5. LLM 预训练:数据、目标函数与 Scaling Law待深入
  6. 大模型微调:Full Fine-tuning、LoRA 与 QLoRA待深入
  7. LLM 后训练:从 SFT、RLHF、DPO 到 GRPO待深入
  8. 推理优化:Continuous Batching、PagedAttention、量化与投机解码待深入