wafer团队整理的一份用于学习 GPU 性能工程和生产级推理的精选资源清单地址:github.com/wafer-ai/gpu-perf-engineering-resources
大模型推理的性能问题不只取决于模型本身,还涉及 GPU 的线程与内存结构、CUDA 内核、低精度计算、推理引擎调度、KV Cache,以及多 GPU 通信等多个层次。性能工程的目标,是在结果正确的前提下,改善延迟、吞吐量、显存占用和硬件利用率。这份资源清单正是按照这些层次组织的。
这个github仓库提供了一条由浅入深的 AI 性能工程学习路径:先理解单次 Transformer 推理中的 prefill、decode、批处理和 KV Cache,再学习 CUDA 执行模型、GPU 内存层次与 Roofline 性能模型;之后进入矩阵乘法、FlashAttention、Tensor Core、FP8/FP4 等内核优化主题;接着扩展到 Triton、CUTLASS、性能分析工具,以及 vLLM、SGLang、TensorRT-LLM 等推理引擎;最后讨论分布式推理、MoE、prefill/decode 分离、生产调度、性能基准和当前硬件。
