基于 sgl-project/rbg 的 PD 分离推理部署实践
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
GPU 收录 6 篇实战文章,覆盖配置方法、故障排查与生产决策。
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
不用供应商小时单价拍脑袋,按有效 GPU 小时、冷启动、闲置、运维和 SLO 计算 Serverless 与独占 GPU 的盈亏平衡点,并设计混合容量迁移路径。
从 Kubernetes GPU 资源语义出发,对比队列回填、NVIDIA Time-Slicing、MIG 和运行时共享,并给出可执行配置、验证指标与回滚边界。
对比 KAI-Scheduler 的 Reservation Pod 调度记账与 HAMi 的 CUDA API 层显存、算力约束,并说明它们和 MIG 硬件隔离的边界。
解读 hetGPU 研究原型提出的跨厂商 GPU 二进制方案,区分论文设计、概念伪代码与当前工程能力。
复盘 tkestack/gpu-manager 的 Device Plugin、vCUDA 资源模型、库注入和拓扑分配,并说明旧 CUDA 兼容边界与现代迁移方案。
按时间倒序查看这个分类下的全部文章。
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
不用供应商小时单价拍脑袋,按有效 GPU 小时、冷启动、闲置、运维和 SLO 计算 Serverless 与独占 GPU 的盈亏平衡点,并设计混合容量迁移路径。
从 Kubernetes GPU 资源语义出发,对比队列回填、NVIDIA Time-Slicing、MIG 和运行时共享,并给出可执行配置、验证指标与回滚边界。
对比 KAI-Scheduler 的 Reservation Pod 调度记账与 HAMi 的 CUDA API 层显存、算力约束,并说明它们和 MIG 硬件隔离的边界。
解读 hetGPU 研究原型提出的跨厂商 GPU 二进制方案,区分论文设计、概念伪代码与当前工程能力。
复盘 tkestack/gpu-manager 的 Device Plugin、vCUDA 资源模型、库注入和拓扑分配,并说明旧 CUDA 兼容边界与现代迁移方案。