yanght27/GPU-Perf-Playground
从手写第一个CUDA算子到跑通vLLM推理、多卡并行训练的自学式GPU性能项目
GPU-Perf-Playground是作者在自己的笔记本(RTX 4070 Laptop)上边做边学搭建的GPU性能与AI Infra学习项目,拆成29个循序渐进的最小任务(Ticket)。内容涵盖用CUDA C++、Triton、PyTorch等五种方式实现同一个算子并对比,用NCU/NSYS做性能取证,再上手vLLM、SGLang、TensorRT-LLM、ms-swift等推理框架,以及PyTorch、DeepSpeed、ms-swift LoRA等训练流程,最后对比DP/TP/PP等并行架构。每个任务都配有一键复现脚本和对应讲义。
它做什么
- 从T00到T28共29个循序渐进的任务,覆盖从环境搭建到AI Infra全链路的学习路径
- 用PyTorch、CUDA C++、Triton、cuTile、CuTe DSL五种方式实现同一算子(如向量加法、GEMM矩阵乘法、Attention)并横向对比
- 用NCU、NSYS做性能测量取证,再实战vLLM、SGLang、TensorRT-LLM、ms-swift等推理框架,以及PyTorch、DeepSpeed(ZeRO)、ms-swift LoRA微调等训练流程
- 最后对比DP、DDP、ZeRO、FSDP、TP、PP、SP、CP等多种并行训练架构
- 每个任务都有一键复现脚本和对应写成文档的讲义(docs/lectures)
为什么重要
对想从零自学GPU性能优化或AI基础设施的人来说,相关资料通常散落在论文和文档里缺乏系统顺序,这个仓库提供了在消费级GPU上实测过、按顺序编排好的学习路径和可运行代码。它更适合当作自学清单或教学参考,而非生产级工具库。
本仓库术语
- CUDA · 让开发者直接在英伟达GPU上编写并行计算代码的编程模型
- Triton · 用类似Python的语法编写GPU算子的编译器
- NCU/NSYS · 英伟达Nsight Compute/Systems,用于精细测量GPU代码执行情况的性能分析工具
- vLLM/SGLang/TensorRT-LLM · 用于加速大语言模型推理(服务)的框架
- DeepSpeed ZeRO · 把模型参数分摊到多张GPU上存储,从而支持训练更大模型的显存优化技术
- DP/TP/PP/SP/CP · 把模型和数据切分到多张GPU上的不同并行策略(数据/张量/流水线/序列/上下文并行)
仓库简介(英文)
GPU 性能与 AI Infra 学习项目:CUDA/Triton 算子、NCU/NSYS、vLLM/SGLang/TRT-LLM/ms-swift、PyTorch/DeepSpeed/ms-swift 训练、并行架构
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库