Skip to content

Latest commit

 

History

1,330 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

rollout-infra — AI Infra 工程师成长之路

从零开始,系统学习 AI 基础设施,成为一名强悍的 AI Infra 工程师

仓库运作规则

工作日志

  • 2026-08-04 — verl #6830 完整 Phase ④(patch+3单测+pytest 39/39);MoonEP #17 静态验证(发现报告者分析 gap);趋势项目推荐(MoonEP/FlashKDA/AReno)
  • 2026-08-03 — 建立 open-source/ 贡献挖掘流水线,verl 首轮扫描产出 3 个候选(#7213 P0 del_local_ckpt bug 为首选)
  • 2026-06-05 — RTX 4090 全面 benchmark、MiniGPT 训练、论文精读 8 篇、DPO/LoRA/RLHF/GRPO 实验、DeepSeek-V3 验证、Top-nσ PR 评估、开源贡献
  • 2026-06-04 — vLLM 安装、推理性能估算工具、LoRA/Tokenizer 笔记
  • 2026-06-03 — GPU 基准测试、vLLM 安装、HuggingFace 推理实验、笔记体系搭建

规划与路线

分布式训练

GPU 编程与优化

RL 训练基础设施

推理与部署

集群与基础设施

开源项目源码阅读

开源贡献挖掘

系统性地从主流开源仓库发现高性价比的贡献机会,按 I×A×F/C 排序产出候选清单。

MoonshotAI 扫描记录

verl 扫描记录

  • 2026-08-03 扫描报告 — 首轮扫描 @ 8bda422,3 个候选(#7213 P0 del_local_ckpt bug / tool_parser 异常 / veomni 类型标注)

论文精读

GPU 实验记录

工具脚本

工具 说明 状态
training_recipe.py 输入模型规格和 GPU 配置,生成 Megatron/DeepSpeed/DDP 训练启动命令 已验证
gpu_benchmark.py GPU 环境验证 + GEMM TFLOPS / HBM 带宽 / 混合精度 / Attention 性能测试 已验证
training_config_guide.py 根据模型大小和硬件推荐并行策略、batch size、梯度累积 已验证
ddp_train_demo.py PyTorch DDP 完整训练示例(多进程、梯度同步、checkpoint) 已验证
comm_benchmark.py 集合通信性能测试(AllReduce/AllGather/ReduceScatter 延迟和带宽) 已验证
ai_infra_cheatsheet.py AI Infra 常用命令速查表(nvidia-smi/nccl/pytorch/triton) 已验证
inference_estimator.py LLM 推理性能估算(显存/KV Cache/吞吐/延迟) 已验证
memory_estimator.py 训练显存估算(参数/梯度/优化器/激活值逐项计算)
scaling_simulator.py 多卡扩展效率模拟(通信占比、线性度、最优卡数)
gpu_monitor.py GPU 实时监控(利用率/显存/温度/功耗)
triton_examples.py Triton kernel 示例集(vector_add/GEMM/softmax/flash_attn)
ddp_cpu_demo.py PyTorch DDP CPU 模式 demo(无 GPU 也可跑)
collective_ops_viz.py 集合通信原语可视化(AllReduce/AllGather/Broadcast 数据流)
vllm_experiment.py vLLM 推理 benchmark(不同 batch/seq 配置、Prefix Caching 测试) 待 GPU
moe_router_demo.py MoE Router 模拟器(Top-K/Capacity 路由、负载均衡分析、Dense vs MoE 对比) 已验证
expert_parallelism_sim.py Expert Parallelism 模拟(All-to-All 通信、EP vs TP vs DP 对比、DeepSeek-V3 EP) 已验证
gpu_profile_experiment.py GPU profiling(GEMM/带宽/Attention/Kernel Launch/Reduction 五类操作) 已验证
cuda_graph_demo.py CUDA Graph 实验(eager vs graph 对比、batch/kernel 数量 scaling) 已验证
flash_attention_bench.py Flash Attention 微基准(SDPA vs Naive、显存对比、序列长度/batch scaling) 已验证
inference_latency_breakdown.py 推理延迟分解(逐操作耗时、GPT-2/LLaMA decode step profiling) 已验证
quantization_bench.py 量化推理 benchmark(FP32/FP16/BF16/INT8 性能+精度+内存对比) 已验证
pytorch_inference_bench.py PyTorch 原生推理 benchmark(KV Cache 加速比、Prefill/Decode 延迟、Batch 扩展效率) 已验证
fp8_simulation.py FP8 量化模拟(E4M3/E5M2 格式、缩放策略、Outlier 影响、误差传播) 已验证
fsdp_memory_sim.py FSDP 内存模拟(DDP vs FSDP 对比、Sharding 策略、Wrapping 分析、Prefetching) 已验证
sampling_simulator.py LLM 采样模拟(Temperature/Top-K/Top-P/Min-P/Beam Search/重复惩罚) 已验证
memory_allocator_sim.py GPU 内存分配器模拟(Naive vs Caching vs Paged, 碎片化分析) 已验证
prefix_caching_sim.py Prefix Caching 模拟(Hash/Trie/Group 策略对比, RL 场景, 收益量化) 已验证
continuous_batching_sim.py Continuous Batching 模拟(Static vs Continuous, 调度策略, KV Cache 压力, Chunked Prefill) 已验证
speculative_decoding_sim.py Speculative Decoding 模拟(Draft-Verify、质量影响、K 最优化、批量扩展) 已验证
disaggregated_serving_sim.py Disaggregated Serving 模拟(Monolithic vs P/D 分离、KV Transfer、实例比例优化) 已验证
flash_attention_sim.py FlashAttention 算法模拟(tiling、online softmax、IO 分析、block size 影响) 已验证
sequence_parallel_sim.py 序列并行模拟(Ulysses vs Ring Attention vs USP、通信量、扩展效率) 已验证
gemm_roofline.py GEMM Roofline 分析(Prefill vs Decode 瓶颈、算术强度、GPU 对比) 已验证
tensor_parallel_sim.py 张量并行通信分析(TP 效率、通信占比、模型规模、推荐策略) 已验证
profiling_guide.py LLM 推理性能诊断(Prefill/Decode 分解、KV 压力、吞吐估算、瓶颈诊断) 已验证
pipeline_parallel_sim.py 流水线并行分析(GPipe vs 1F1B 气泡、micro-batch 影响、3D 并行策略推荐) 已验证
training_optimizer_sim.py 训练优化模拟(梯度累积、混合精度、梯度检查点、综合显存估算) 已验证
collective_comm_sim.py 集合通信深度分析(Ring/Tree AllReduce、AllGather/ReduceScatter、通信重叠) 已验证
nccl_tuning_sim.py NCCL 调优参数分析(算法/协议选择、通道调优、跨节点拓扑、速查表) 已验证
checkpoint_perf_sim.py Checkpoint 性能分析(大小估算、保存策略、加载恢复、存储推荐) 已验证
dataloader_perf_sim.py DataLoader 优化分析(加载瓶颈、Prefetch 预取、存储对比、调优推荐) 已验证
ray_schedule_sim.py Ray 分布式调度模拟(Actor/Task 调度、Placement Group、RLHF PPO) 已验证
long_context_serving_sim.py 长上下文推理模拟(KV Cache 压力、Chunked Prefill、Sliding Window、Prefix Caching、服务策略) 已验证
inference_planner.py LLM 推理端到端规划器(单卡部署、多卡并行策略、Batch 优化、成本效率) 已验证
kv_cache_offload_sim.py KV Cache 分层存储模拟(GPU/CPU/SSD 三层容量、Offload 性能、服务策略、成本优化) 已验证
chunked_prefill_sim.py Chunked Prefill 模拟(无 chunking vs chunked、chunk size 影响、并发调度、Prefix Caching 组合) 已验证
kv_cache_quant_sim.py KV Cache 量化模拟(FP16/FP8/INT4/2-bit 对比、Batch 影响、组合优化、成本效率) 已验证
serving_framework_compare.py LLM Serving 框架对比(vLLM/SGLang/TRT-LLM 吞吐、KV 共享、结构化生成、扩展效率) 已验证
inference_cost_calculator.py LLM 推理部署成本计算器(GPU 选型、量化策略、场景成本、能效分析) 已验证
cuda_kernel_simulator.py CUDA Kernel 执行模拟器(Grid/Block、内存层次、Occupancy、Roofline 分析) 已验证
cuda_stream_simulator.py CUDA Stream 并发模型模拟器(通信计算重叠、TP overlap、vLLM 多 Stream) 已验证
nccl_tuning_cheatsheet.py NCCL 调优速查表(算法选择、通道调优、多节点配置、问题排查) 已验证
llm_latency_estimator.py LLM 推理延迟估算器(Prefill/Decode 分解、TP 影响、场景估算、GPU 对比) 已验证
model_compression_analyzer.py LLM 模型压缩策略分析器(蒸馏/剪枝/量化/综合策略对比、生产部署选型) 已验证
dp_serving_simulator.py Data Parallel Serving 模拟器(DP vs TP 扩展、MoE EP、Wave 协调、DBO、生产选型) 已验证
engine_core_simulator.py Engine Core 模拟器(step 循环、Batch Queue、ZMQ 通信、KV auto-fit、GPU 利用率) 已验证
triton_practice.py Triton Kernel 实战练习(Vector Add、Fused OP、Softmax、Tiled GEMM、Flash Attention) 已验证
rlhf_training_simulator.py RLHF/GRPO 训练模拟器(PPO vs GRPO、KL 惩罚、Prefix Caching、分布式扩展) 已验证
distributed_training_comm_simulator.py 分布式训练通信模拟器(AllReduce、ZeRO、MoE A2A、1F1B overlap、生产配置) 已验证

日志记录规范

  • 文件: diary/YYYY-MM-DD.md,每天一个文件
  • 颗粒度: 每完成一件事(学一个知识点、做一个实验、写一个工具)就记录一条
  • 格式: HH:MM — 标题 + 2-3 句话,包含做了什么、为什么做、得出了什么结论或思考
  • 顺序: 按时间正序排列(最早的在最前面)
  • 要求: 不要太简略(不能只列名字),也不要太冗长;要能看到进展、结论和思考

笔记记录规范

  • 基础知识: notebook/fundamentals/ — 每篇包含目标、核心概念、实践记录、参考资料
  • 项目源码: notebook/projects/ — 源码阅读和分析笔记
  • 实验记录: notebook/experiments/ — GPU 实验数据和结论
  • 规划文档: notebook/roadmap.md, notebook/knowledge-map.md

工具沉淀规范

  • 每个工具独立可运行(有 if __name__ == "__main__" 入口)
  • 包含 docstring 说明用法
  • 验证状态标注在上方的目录树中

Git 管理规范

  • 每完成一个有意义的任务就 commit + push
  • commit message 简要说明变更内容
  • 所有变更通过 git 管理,不手动管理文件

环境信息

  • 本地 conda: ai-infra (Python 3.11, macOS)
  • GPU 服务器: matpool.com A16 15GB, myconda 环境 (Python 3.9, PyTorch 2.0+cu117)
  • GPU 连接: source /root/miniconda3/bin/activate myconda(必须激活,不能用系统 Python)
  • 镜像源: pip 用清华/阿里云镜像(中国大陆网络)

统计

类别 数量
基础知识笔记 48+ 篇
项目源码阅读 34+ 篇
论文精读 11 篇
实验记录 (RTX 4090) 17 篇
实用工具脚本 137+ 个
Claude Code Skills 5 个
总计 312+ 项

GitHub

https://github.com/Jackie2049/rollout-infra

About

AI Infra Engineer Learning Hub — 学习笔记与实战记录

Resources

Stars

6 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages