king-of-water · 个人博客

你好,我是
king-of-water。

这里记录后端、Agent 实践、项目,以及真正用过的工具。

数据库增加副本后,为什么仍会读到旧数据:主从复制、读写分离与 Quorum

从短链接创建后立即访问却返回 404 的问题出发,讲清复制日志、复制延迟、读己之写、半同步复制、主从切换,以及 Quorum 读写集合的保证与边界。

分布式系统MySQL数据库复制读写分离复制延迟Quorum一致性

数据超过单机后怎么拆:分片键、路由、扩容迁移与一致性哈希

从短链接读写路径与支付流水实战出发,讲清分片键怎么选、全局 ID 为什么不能自动路由、取模与基因法怎样工作,以及扩容时如何迁移数据并验证正确性。

分布式系统分库分表分片键数据路由一致性哈希数据迁移MySQL

分布式事务:2PC、TCC、Saga、Outbox 与事务消息怎样选

从一条支付、业务确认与退款链路出发,区分原子提交、资源预留、补偿事务和可靠消息,讲清 2PC、TCC、Saga、Outbox 与事务消息的适用边界。

分布式系统分布式事务2PCTCCSagaOutbox事务消息状态机

现代 LLM 的 Transformer:从 Token 输入到下一个 Token

从一条具体的请求出发,逐层拆解现代 Decoder-only Transformer 的每个组件:Embedding、RoPE 位置编码、RMSNorm、GQA 注意力、SwiGLU 前馈层、残差连接,以及 logits 到采样的完整流程。解释每个设计决策相比原始 Transformer 改了什么、为什么改。

LLMTransformerDecoderRoPERMSNormGQASwiGLU采样推理

《Attention Is All You Need》精读:Transformer 解决了什么

2017 年这篇论文为什么重要?从序列建模的历史困境出发,逐步拆解 Transformer 的每个设计决策——为什么抛弃 RNN、Self-Attention 的计算逻辑、Multi-Head 的作用、位置编码的必要性——以及这些决策为后来的 GPT 和 BERT 路线奠定了什么基础。

LLMTransformerAttentionSelf-Attention论文精读RNN序列建模

推理优化:Continuous Batching、量化与投机解码

从"为什么 GPU 在推理时经常空转"出发,拆解三类推理优化技术:Continuous Batching 让 GPU 不浪费等待,量化(INT8/INT4/GPTQ/AWQ)缩小模型降低带宽压力,投机解码用小模型草稿加速大模型验证。这些优化合起来能让推理吞吐量提升 10-30 倍。

LLM推理优化Continuous Batching量化投机解码vLLMPagedAttention吞吐量