基于 sgl-project/rbg 的 PD 分离推理部署实践
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
GPU / GPU 加速 收录 4 篇实战文章,覆盖配置方法、故障排查与生产决策。
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
对比 KAI-Scheduler 的 Reservation Pod 调度记账与 HAMi 的 CUDA API 层显存、算力约束,并说明它们和 MIG 硬件隔离的边界。
解读 hetGPU 研究原型提出的跨厂商 GPU 二进制方案,区分论文设计、概念伪代码与当前工程能力。
复盘 tkestack/gpu-manager 的 Device Plugin、vCUDA 资源模型、库注入和拓扑分配,并说明旧 CUDA 兼容边界与现代迁移方案。
按时间倒序查看这个分类下的全部文章。
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
对比 KAI-Scheduler 的 Reservation Pod 调度记账与 HAMi 的 CUDA API 层显存、算力约束,并说明它们和 MIG 硬件隔离的边界。
解读 hetGPU 研究原型提出的跨厂商 GPU 二进制方案,区分论文设计、概念伪代码与当前工程能力。
复盘 tkestack/gpu-manager 的 Device Plugin、vCUDA 资源模型、库注入和拓扑分配,并说明旧 CUDA 兼容边界与现代迁移方案。