从零开始,系统学习 AI 基础设施,成为一名强悍的 AI Infra 工程师
- 2026-08-04 — verl #6830 完整 Phase ④(patch+3单测+pytest 39/39);MoonEP #17 静态验证(发现报告者分析 gap);趋势项目推荐(MoonEP/FlashKDA/AReno)
- 2026-08-03 — 建立 open-source/ 贡献挖掘流水线,verl 首轮扫描产出 3 个候选(#7213 P0 del_local_ckpt bug 为首选)
- 2026-06-05 — RTX 4090 全面 benchmark、MiniGPT 训练、论文精读 8 篇、DPO/LoRA/RLHF/GRPO 实验、DeepSeek-V3 验证、Top-nσ PR 评估、开源贡献
- 2026-06-04 — vLLM 安装、推理性能估算工具、LoRA/Tokenizer 笔记
- 2026-06-03 — GPU 基准测试、vLLM 安装、HuggingFace 推理实验、笔记体系搭建
- 学习路线图 — Phase 1-5 学习计划,从分布式训练到 vLLM 开源贡献
- 知识地图 — AI Infra 8 大领域技能树,标注掌握程度
- GPU 实验计划 — A16 GPU 上的实验清单和优先级
- 分布式训练总览 — DP/TP/PP/SP 演进逻辑,通信原语图解
- ZeRO 优化器 — ZeRO 1/2/3 原理、显存公式、适用场景
- FSDP 全分片数据并行 — FlattenParameter、Sharding 策略、Prefetching、verl FSDP 实践
- 混合精度训练 — FP16/BF16/FP8、Loss Scaling、Tensor Core 利用
- 梯度检查点 — 激活重计算策略,用计算换显存
- NCCL 通信库 — Ring/Tree AllReduce、调优参数、网络拓扑
- RDMA 高性能网络 — InfiniBand/RoCE/iWARP、GPUDirect RDMA、NCCL 调优、实战排错
- CUDA 编程基础 — Grid/Block/Thread、内存层次、Coalesced Access、Occupancy、Roofline Model
- 通信与计算重叠 — DDP Bucket Overlap、1F1B、ZeRO-3 Prefetch
- MoE 混合专家架构 — 稀疏激活、Top-K 路由、负载均衡、Expert Parallelism、DeepSeek-V3
- 序列并行 — DeepSpeed Ulysses、Ring Attention、USP 统一框架
- Ray 分布式框架 — Actor/Task 模型、Placement Group、RLHF 调度
- 分布式 Checkpoint — 分片保存、异步 IO、mmap 加速加载
- DataLoader 优化 — Prefetch、mmap、WebDataset 流式加载
- CUDA 编程基础 — 线程层次、内存模型、流、Tensor Core
- Triton 编程 — OpenAI Triton:kernel、autotune、GEMM、FlashAttention
- torch.compile 与 Inductor — Dynamo 图捕获、Triton 代码生成、CUDA Graphs 集成
- FlashAttention — 1/2/3 深度解析,tiling、online softmax、IO 复杂度
- Attention Kernel 优化 — FlashAttention-3/4、FlashInfer、FlashMLA 对比与选型
- RoPE 旋转位置编码 — 数学推导、四种实现、五种长度扩展方法、推理优化
- KV Cache 深度解析 — 显存估算、PagedAttention、GQA/MQA、Prefix Caching、量化
- KV Cache 量化 — FP8/INT8/INT4/2-bit 量化对比、KIVI/KVQuant、vLL8 实践、组合优化
- Multi-head Latent Attention — DeepSeek-V2 MLA 低秩 KV 压缩、解耦 RoPE、矩阵吸收、93.3% KV Cache 减少
- Prefix Caching 深度对比 — vLLM Hash vs SGLang Radix vs verl Group、收益量化
- GPU 显存优化 — 训练显存估算公式、OOM 排查、ZeRO、碎片化
- GPU 内存分配器 — PyTorch Caching Allocator、vLLM Paged Memory、碎片化分析
- CUDA Graphs — 推理场景 kernel launch 开销优化,录制重放机制
- GPU 性能分析 — 四层方法:nvidia-smi → nsys → ncu → ncu detail
- LLM 推理服务框架 — vLLM/SGLang/TGI/Triton 对比,K8s 生产部署,负载均衡策略
- SGLang RadixAttention — 基数树前缀缓存、节点分裂机制、缓存感知调度、与 vLLM Hash-based 对比
- 推理服务监控与可观测性 — vLLM 30+ Prometheus 指标、SLO 定义、告警规则、DCGM GPU 监控、瓶颈定位
- RLHF/GRPO 训练基础设施 — PPO 四模型架构、GRPO 无 Critic、verl/OpenRLHF 框架、Prefix Sharing
- DPO 直接偏好优化 — 跳过 RM 和 RL 的对齐方法、IPO/KTO/SimPO 变体
- LoRA 与参数高效微调 — 低秩分解原理、QLoRA、多 LoRA 服务、RLHF 中的应用
- Speculative Decoding — Draft-Verify、Medusa、Eagle 投机采样
- Continuous Batching — Static→Continuous 演进、Chunked Prefill、调度策略
- Tokenizer 与推理管线 — BPE、词表大小影响、压缩率与推理成本、特殊 Tokens
- 推理量化 — GPTQ/AWQ/SmoothQuant/FP8 量化方法对比
- FP8 量化与训练 — E4M3/E5M2 格式、缩放策略、Transformer Engine、vLLM FP8 实现
- 模型服务架构 — API 网关、负载均衡、HPA 自动扩缩容
- 长上下文 LLM 推理服务 — KV Cache 显存压力、Chunked Prefill、Sliding Window、服务策略
- Chunked Prefill 深度解析 — vLLM V1 统一调度模型、Chunk Size 三层约束、Partial Prefill 处理、Prefix Caching 组合
- Disaggregated Serving — Prefill/Decode 分离、KV Transfer、Splitwise/Mooncake 架构
- LLM 采样方法 — Temperature/Top-K/Top-P/Min-P/Beam Search/重复惩罚
- K8s GPU 调度 — Device Plugin、MIG、Gang Scheduling
- Slurm 集群管理 — sbatch 提交、NCCL 配置、抢占式调度
- 分布式文件系统 — Lustre 条带化、IO 优化、并行读写
系统性地从主流开源仓库发现高性价比的贡献机会,按 I×A×F/C 排序产出候选清单。
- 开源贡献挖掘 SOP — 5 阶段流水线、P0-P4 优先级、性价比评分公式
- verl 贡献追踪 — 跨扫描持久追踪(候选 → PR → merged/rejected)
- MoonshotAI 贡献追踪 — MoonEP/FlashKDA/minitriton 候选追踪(MoonEP 是 Kimi K3 EP 基础设施)
- 2026-08-03 扫描报告 — 首轮扫描 @
8bda422,3 个候选(#7213 P0 del_local_ckpt bug / tool_parser 异常 / veomni 类型标注)
-
Attention is All You Need — Transformer 原始论文, QK^T/√d_k 缩放, 多头注意力, 现代架构对比
-
DeepSeek-R1 — GRPO, "Aha Moment", Cold-start SFT → GRPO → Rejection Sampling SFT → DPO
-
InstructGPT — RLHF 三步 pipeline, 1.3B InstructGPT > 175B GPT-3
-
LLaMA 3 — 简单架构+大数据=强模型, 405B 16K H100 训练, DPO 对齐
-
FlashAttention — Tiling + online softmax + recomputation, O(N) 内存
-
Chinchilla Scaling Laws — L(N,D) 最优 ~20 tok/param, 推翻 Kaplan "大模型少数据"
-
PPO — L^{CLIP}, RLHF 核心算法, GRPO 简化版
-
GPT-4 — 可预测扩展, RLHF 无损, RBRMs 安全
-
Mamba — 选择性 SSM, 线性时间, 2.8B 匹配 GPT-J-6B
-
Top-nσ — ACL 2025, logit 空间统计阈值, 温度稳定性 1.00x
-
DeepSeek-V3 — 671B/37B MoE, 辅助无关负载均衡, FP8 tile-wise, MTP, DualPipe
-
vLLM V1 架构 — V1 整体架构、Scheduler/Executor 分离、混合推理
-
vLLM KV Transfer Connector — NIXL 连接器架构、P/D 分离、ZMQ 握手、TP 聚合
-
vLLM V1 Scheduler 源码阅读 — 调度循环、抢占策略、KV Cache 管理、Prefix Caching 集成
-
vLLM 投机解码源码阅读 — Draft-Verify、Eagle/Medusa/Ngram proposer、Rejection Sampling
-
vLLM Prefix Caching V1 — Hash chain、block 生命周期、四种 attention 缓存策略
-
vLLM 开源贡献计划 — 11 个 good first issue 筛选和分析
-
vLLM 贡献准备 — FlashInfer 后端分析、开发环境搭建
-
Megatron-LM 张量并行 — ColumnParallelLinear/RowParallelLinear 源码
-
Megatron-LM TP 源码深度阅读 — 通信原语 autograd、TP 数据流、权重分发、SP 扩展、3D 并行交互
-
Megatron-LM 流水线并行 — 1F1B 调度、气泡分析、通信 overlap
-
verl 架构 — 三级前缀缓存(系统级+进程级+请求级)
-
vLLM MLA Backend 源码阅读 — FlashMLA/FlashInfer/Triton/Cutlass MLA 后端、压缩数据流、KV Cache 格式、Backend 选择
-
verl PrefixGrouper — RL 训练中 prompt 复用的分组与调度
-
vLLM V1 KV Cache Manager 源码阅读 — Block 分配/释放、6 种 Attention Manager、Prefix Caching、Coordinator 架构
-
vLLM V1 Executor 源码阅读 — Executor→Worker→ModelRunner→AttentionBackend 完整执行路径、CUDA Graph、20+ Attention Backend
-
vLLM MoE Serving 源码阅读 — 模块化 MoE kernel 架构、8+ All-to-All 后端、Router/Experts/Prepare-Finalize 分离
-
verl 源码架构阅读 — HybridFlow RL 训练框架、PPO/GRPO 循环、FSDP+混合推理引擎、Prefix Grouper
-
verl RL Infra 架构源码阅读 — SyncPPOTrainer、ActorRolloutRefWorker、GRPO/GAE、TransferQueue、vLLM Rollout
-
vLLM 量化推理管线源码阅读 — 量化方法注册表、Kernel 选择逻辑、离线/在线量化、QuantKey 系统
-
vLLM 权重加载管线源码阅读 — safetensors 到 GPU 全流程、TP/PP/EP 分片、weight_loader 机制
-
vLLM P/D 分离架构源码阅读 — KV Connector 抽象、NIXL 实现、异步传输、异构 TP、部署配置
-
vLLM CUDA Graph 源码阅读 — FULL/PIECEWISE 模式、捕获回放流程、Attention 兼容、Breakable Graph
-
vLLM V1 架构全景图 — 请求生命周期、四层架构、模块依赖关系、已学清单
-
vLLM Sampling Pipeline 源码阅读 — Logits 到 Token 完整管线、Top-K/P 实现、Penalty、CUDA Graph 兼容
-
vLLM Data Parallel Serving 源码阅读 — DP vs TP 扩展、MoE EP、Wave 协调、DBO、Elastic EP
-
vLLM V1 可观测性与指标体系 源码阅读 — Stats 采集、Prometheus 指标、Logging、告警建议
-
vLLM LoRA Serving 源码阅读 — Punica Multi-LoRA、批量 LoRA kernel、MoE+LoRA、权重管理
-
vLLM Multi-Modal Processing 源码阅读 — MM 数据流、EncoderRunner、Hash-based Caching、Vision Encoder 集成
-
vLLM Structured Output 源码阅读 — JSON/Grammar/Regex Bitmask 过滤、FSM 驱动、XGrammar 后端
-
vLLM AsyncLLM Engine Frontend 源码阅读 — 双进程架构、output_handler、InputProcessor/OutputProcessor、ZMQ 通信
-
vLLM V1 Engine Core 源码阅读 — step() 核心循环、KV Cache 初始化、Busy Loop、ZMQ 双线程、DP 扩展
-
GRPO 实战指南 — verl 框架 GRPO 训练完整流程、数据格式、配置参数、奖励函数
-
SGLang 架构深度分析 — RadixAttention 基数树、DSL 前端、FlashInfer 集成、vs vLLM 对比
-
分布式训练排错指南 — NCCL 超时、OOM、梯度异常等常见问题
- A16 基准测试 — GEMM 14.64 TFLOPS、HBM 76 GB/s、混合精度 3.9x 加速
- vLLM GPT-2 推理 — vLLM 0.6.4+cu118, Batch=16 达 1875 tok/s, Flash Attention 后端
- GPU Profiling 深度实验 — GEMM/带宽/Attention/Kernel Launch 五类操作 profiling,A16 约为 A100 的 1/10 性能
- RTX 4090 全面 Benchmark — SDPA 162 TFLOPS, Decode 529K tok/s, CUDA Graph 1.02x, KV Cache 分析
- RTX 4090 MoE Layer — MoE vs Dense, Python 循环 5.8-26.3x 开销, aux_loss ≈ 1.0
- RTX 4090 Training Techniques — AdamW>>Adam 4.13 vs 6.57, BF16 省 29%, cosine warmup
- RTX 4090 PPO Training — PPO 比 Vanilla PG 好 24%, KL β=0.01 最优
- RTX 4090 KV Cache Compression — INT8 cos=0.9999 安全, SW-4K 省 97%
- RTX 4090 Ring Attention — Online softmax 精确 err<6e-7, 通信量与 P 无关
- RTX 4090 Mini LLM Training — Pretrain loss 4.92→2.46, SFT loss 1.68→1.11
- RTX 4090 DPO Training — DPO preference accuracy 99.7%, β=0.3 最优
- RTX 4090 LoRA Fine-tuning — LoRA r=8 仅 7.13% 参数, merge 零推理开销
- RTX 4090 Multi-GPU DDP — 4 GPU 3.23x (80.7% 效率), PCIe AllReduce 4.9 GB/s
- RTX 4090 RLHF/GRPO — GRPO 比 PPO 稳定, group size n=2-4 最优
- RTX 4090 Triton Kernels — RMSNorm 1.8x, memory BW 945 GB/s = 93.7% peak
- RTX 4090 Top-nσ Sampling — 温度稳定性 1.00x vs top-p 19,665x
- RTX 4090 DeepSeek-V3 MoE — Bias-based 零性能损失, FP8 tile-wise cos=1.0
| 工具 | 说明 | 状态 |
|---|---|---|
| training_recipe.py | 输入模型规格和 GPU 配置,生成 Megatron/DeepSpeed/DDP 训练启动命令 | 已验证 |
| gpu_benchmark.py | GPU 环境验证 + GEMM TFLOPS / HBM 带宽 / 混合精度 / Attention 性能测试 | 已验证 |
| training_config_guide.py | 根据模型大小和硬件推荐并行策略、batch size、梯度累积 | 已验证 |
| ddp_train_demo.py | PyTorch DDP 完整训练示例(多进程、梯度同步、checkpoint) | 已验证 |
| comm_benchmark.py | 集合通信性能测试(AllReduce/AllGather/ReduceScatter 延迟和带宽) | 已验证 |
| ai_infra_cheatsheet.py | AI Infra 常用命令速查表(nvidia-smi/nccl/pytorch/triton) | 已验证 |
| inference_estimator.py | LLM 推理性能估算(显存/KV Cache/吞吐/延迟) | 已验证 |
| memory_estimator.py | 训练显存估算(参数/梯度/优化器/激活值逐项计算) | |
| scaling_simulator.py | 多卡扩展效率模拟(通信占比、线性度、最优卡数) | |
| gpu_monitor.py | GPU 实时监控(利用率/显存/温度/功耗) | |
| triton_examples.py | Triton kernel 示例集(vector_add/GEMM/softmax/flash_attn) | |
| ddp_cpu_demo.py | PyTorch DDP CPU 模式 demo(无 GPU 也可跑) | |
| collective_ops_viz.py | 集合通信原语可视化(AllReduce/AllGather/Broadcast 数据流) | |
| vllm_experiment.py | vLLM 推理 benchmark(不同 batch/seq 配置、Prefix Caching 测试) | 待 GPU |
| moe_router_demo.py | MoE Router 模拟器(Top-K/Capacity 路由、负载均衡分析、Dense vs MoE 对比) | 已验证 |
| expert_parallelism_sim.py | Expert Parallelism 模拟(All-to-All 通信、EP vs TP vs DP 对比、DeepSeek-V3 EP) | 已验证 |
| gpu_profile_experiment.py | GPU profiling(GEMM/带宽/Attention/Kernel Launch/Reduction 五类操作) | 已验证 |
| cuda_graph_demo.py | CUDA Graph 实验(eager vs graph 对比、batch/kernel 数量 scaling) | 已验证 |
| flash_attention_bench.py | Flash Attention 微基准(SDPA vs Naive、显存对比、序列长度/batch scaling) | 已验证 |
| inference_latency_breakdown.py | 推理延迟分解(逐操作耗时、GPT-2/LLaMA decode step profiling) | 已验证 |
| quantization_bench.py | 量化推理 benchmark(FP32/FP16/BF16/INT8 性能+精度+内存对比) | 已验证 |
| pytorch_inference_bench.py | PyTorch 原生推理 benchmark(KV Cache 加速比、Prefill/Decode 延迟、Batch 扩展效率) | 已验证 |
| fp8_simulation.py | FP8 量化模拟(E4M3/E5M2 格式、缩放策略、Outlier 影响、误差传播) | 已验证 |
| fsdp_memory_sim.py | FSDP 内存模拟(DDP vs FSDP 对比、Sharding 策略、Wrapping 分析、Prefetching) | 已验证 |
| sampling_simulator.py | LLM 采样模拟(Temperature/Top-K/Top-P/Min-P/Beam Search/重复惩罚) | 已验证 |
| memory_allocator_sim.py | GPU 内存分配器模拟(Naive vs Caching vs Paged, 碎片化分析) | 已验证 |
| prefix_caching_sim.py | Prefix Caching 模拟(Hash/Trie/Group 策略对比, RL 场景, 收益量化) | 已验证 |
| continuous_batching_sim.py | Continuous Batching 模拟(Static vs Continuous, 调度策略, KV Cache 压力, Chunked Prefill) | 已验证 |
| speculative_decoding_sim.py | Speculative Decoding 模拟(Draft-Verify、质量影响、K 最优化、批量扩展) | 已验证 |
| disaggregated_serving_sim.py | Disaggregated Serving 模拟(Monolithic vs P/D 分离、KV Transfer、实例比例优化) | 已验证 |
| flash_attention_sim.py | FlashAttention 算法模拟(tiling、online softmax、IO 分析、block size 影响) | 已验证 |
| sequence_parallel_sim.py | 序列并行模拟(Ulysses vs Ring Attention vs USP、通信量、扩展效率) | 已验证 |
| gemm_roofline.py | GEMM Roofline 分析(Prefill vs Decode 瓶颈、算术强度、GPU 对比) | 已验证 |
| tensor_parallel_sim.py | 张量并行通信分析(TP 效率、通信占比、模型规模、推荐策略) | 已验证 |
| profiling_guide.py | LLM 推理性能诊断(Prefill/Decode 分解、KV 压力、吞吐估算、瓶颈诊断) | 已验证 |
| pipeline_parallel_sim.py | 流水线并行分析(GPipe vs 1F1B 气泡、micro-batch 影响、3D 并行策略推荐) | 已验证 |
| training_optimizer_sim.py | 训练优化模拟(梯度累积、混合精度、梯度检查点、综合显存估算) | 已验证 |
| collective_comm_sim.py | 集合通信深度分析(Ring/Tree AllReduce、AllGather/ReduceScatter、通信重叠) | 已验证 |
| nccl_tuning_sim.py | NCCL 调优参数分析(算法/协议选择、通道调优、跨节点拓扑、速查表) | 已验证 |
| checkpoint_perf_sim.py | Checkpoint 性能分析(大小估算、保存策略、加载恢复、存储推荐) | 已验证 |
| dataloader_perf_sim.py | DataLoader 优化分析(加载瓶颈、Prefetch 预取、存储对比、调优推荐) | 已验证 |
| ray_schedule_sim.py | Ray 分布式调度模拟(Actor/Task 调度、Placement Group、RLHF PPO) | 已验证 |
| long_context_serving_sim.py | 长上下文推理模拟(KV Cache 压力、Chunked Prefill、Sliding Window、Prefix Caching、服务策略) | 已验证 |
| inference_planner.py | LLM 推理端到端规划器(单卡部署、多卡并行策略、Batch 优化、成本效率) | 已验证 |
| kv_cache_offload_sim.py | KV Cache 分层存储模拟(GPU/CPU/SSD 三层容量、Offload 性能、服务策略、成本优化) | 已验证 |
| chunked_prefill_sim.py | Chunked Prefill 模拟(无 chunking vs chunked、chunk size 影响、并发调度、Prefix Caching 组合) | 已验证 |
| kv_cache_quant_sim.py | KV Cache 量化模拟(FP16/FP8/INT4/2-bit 对比、Batch 影响、组合优化、成本效率) | 已验证 |
| serving_framework_compare.py | LLM Serving 框架对比(vLLM/SGLang/TRT-LLM 吞吐、KV 共享、结构化生成、扩展效率) | 已验证 |
| inference_cost_calculator.py | LLM 推理部署成本计算器(GPU 选型、量化策略、场景成本、能效分析) | 已验证 |
| cuda_kernel_simulator.py | CUDA Kernel 执行模拟器(Grid/Block、内存层次、Occupancy、Roofline 分析) | 已验证 |
| cuda_stream_simulator.py | CUDA Stream 并发模型模拟器(通信计算重叠、TP overlap、vLLM 多 Stream) | 已验证 |
| nccl_tuning_cheatsheet.py | NCCL 调优速查表(算法选择、通道调优、多节点配置、问题排查) | 已验证 |
| llm_latency_estimator.py | LLM 推理延迟估算器(Prefill/Decode 分解、TP 影响、场景估算、GPU 对比) | 已验证 |
| model_compression_analyzer.py | LLM 模型压缩策略分析器(蒸馏/剪枝/量化/综合策略对比、生产部署选型) | 已验证 |
| dp_serving_simulator.py | Data Parallel Serving 模拟器(DP vs TP 扩展、MoE EP、Wave 协调、DBO、生产选型) | 已验证 |
| engine_core_simulator.py | Engine Core 模拟器(step 循环、Batch Queue、ZMQ 通信、KV auto-fit、GPU 利用率) | 已验证 |
| triton_practice.py | Triton Kernel 实战练习(Vector Add、Fused OP、Softmax、Tiled GEMM、Flash Attention) | 已验证 |
| rlhf_training_simulator.py | RLHF/GRPO 训练模拟器(PPO vs GRPO、KL 惩罚、Prefix Caching、分布式扩展) | 已验证 |
| distributed_training_comm_simulator.py | 分布式训练通信模拟器(AllReduce、ZeRO、MoE A2A、1F1B overlap、生产配置) | 已验证 |
- 文件:
diary/YYYY-MM-DD.md,每天一个文件 - 颗粒度: 每完成一件事(学一个知识点、做一个实验、写一个工具)就记录一条
- 格式:
HH:MM — 标题+ 2-3 句话,包含做了什么、为什么做、得出了什么结论或思考 - 顺序: 按时间正序排列(最早的在最前面)
- 要求: 不要太简略(不能只列名字),也不要太冗长;要能看到进展、结论和思考
- 基础知识:
notebook/fundamentals/— 每篇包含目标、核心概念、实践记录、参考资料 - 项目源码:
notebook/projects/— 源码阅读和分析笔记 - 实验记录:
notebook/experiments/— GPU 实验数据和结论 - 规划文档:
notebook/roadmap.md,notebook/knowledge-map.md
- 每个工具独立可运行(有
if __name__ == "__main__"入口) - 包含 docstring 说明用法
- 验证状态标注在上方的目录树中
- 每完成一个有意义的任务就 commit + push
- commit message 简要说明变更内容
- 所有变更通过 git 管理,不手动管理文件
- 本地 conda:
ai-infra(Python 3.11, macOS) - GPU 服务器: matpool.com A16 15GB,
myconda环境 (Python 3.9, PyTorch 2.0+cu117) - GPU 连接:
source /root/miniconda3/bin/activate myconda(必须激活,不能用系统 Python) - 镜像源: pip 用清华/阿里云镜像(中国大陆网络)
| 类别 | 数量 |
|---|---|
| 基础知识笔记 | 48+ 篇 |
| 项目源码阅读 | 34+ 篇 |
| 论文精读 | 11 篇 |
| 实验记录 (RTX 4090) | 17 篇 |
| 实用工具脚本 | 137+ 个 |
| Claude Code Skills | 5 个 |
| 总计 | 312+ 项 |