DC娱乐网

不同LoRA请求为何还能放进同一Batch? 不同LoRA请求为何还能放进同一B

不同LoRA请求为何还能放进同一Batch?
不同LoRA请求为何还能放进同一Batch?

每个用户权重不同,batch不是应该拆开吗?今天讲透Punica👇
🌟 先说结论(划重点‼️):
✅ base model计算先跨租户共享
✅ SGMV按segment选择各自LoRA小矩阵
✅ 论文多租户吞吐最高12×,只增约2ms/token
后面有12租户合批账、S-LoRA对比和rank边界。
大模型 LLM Punica LoRA 多租户 模型推理 CUDA AI面试