🧠
核心公式
LLM 推理引擎 = Tokenizer + Attention + KV Cache + Scheduler + PagedAttention
vLLM 是目前最主流的 LLM 推理引擎之一,但它的代码量超过 10 万行,直接阅读源码门槛很高。
这个教程用 20 步把 vLLM 的核心原理拆解成可独立运行的最小实现:每步只加一个概念,代码量控制在几百行以内,配合 ASCII 图解和对比实验,让你真正理解每个优化为什么有效。
| 阶段 | 章节 | 核心问题 |
|---|---|---|
| 基础概念 | step01–04 | Token → Embedding → Attention → Transformer |
| 朴素推理 | step05–06 | 自回归生成 + 采样策略 |
| KV Cache | step07–08 | O(n²) → O(n),Static Batching |
| 调度 | step09–11 | Continuous Batching → Chunked Prefill → Preemption |
| PagedAttention | step12–14 | 分页内存 + 前缀缓存 |
| 高性能内核 | step15–16 | FlashAttention + CUDA Graph |
| 分布式 | step17 | Tensor Parallelism |
| 工程落地 | step18–20 | Benchmark + Real Model + HTTP 服务 |
# 安装依赖(CPU 版,前 8 步够用)
pip install -r requirements-cpu.txt
# 从第一步开始
cd step01_tokenizer
python run.py本项目是 nano-vllm 的教学版本: