推荐一个很实用的项目,对于想系统掌握大模型推理、而不只是跑通 demo的人,一定会有很大帮助。它的名字叫 100 Days of Inference。
它基于 Philip Kiely 的《Inference Engineering》而来,涉及以下方向——
1.单 GPU 推理优化:量化、KV Cache、CUDA 内核、Flash/Speculative decoding;
2.多机扩展:容器化、自动扩缩、路由;
3. 生产化部署:观测、监控、稳定性与工程落地;
4. 多模态与前沿方向:视觉、语音、MoE、长上下文等等。
它绝非单纯去堆概念啥的,而是通过“每日实战 + 可复现实验 + 可视化理解”的组合拳,帮助用户实现从原理到生产的快速上手实战。
所以,这个项目就比较适合下面这些人群——
1.想从 LLM 应用开发,转向推理工程、AI Infra 的人;
2. 已会跑模型,但想搞懂性能瓶颈的用户们;
3. 想系统学:从单卡优化到多机部署的人士;
4. 打算用脚本和实验去验证概念,而非仅读文档的朋友。
大家可以把它当成“推理工程实战清单”来使用!
1. 先明确你当前所处之阶段:单卡优化 / 多机部署 / 生产观测……;
2. 从最接近你的工作场景的脚本开始跑,这样最务实;
3. 不要光收藏落灰,要边跑边记录实验结果哦;
4. 把每次实验的 TTFT、吞吐、显存、延迟变化之类的情况,都一五一十地记录下来。
项目地址:
github点com/elizabetht/100-days-of-inference
有需要的朋友,快来试试吧!
