基于 sgl-project/rbg 的 PD 分离推理部署实践
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
从真实故障出发理解 Liveness、Readiness 和 Startup Probe 的职责边界,避免误探测导致重启和流量异常。
通过可复现程序和 /proc、strace 观察 glibc malloc 如何使用 brk、mmap、madvise,以及 free 后 RSS 为何不一定下降。
在不把 curl/dig/tcpdump 打进生产镜像的前提下,安全地进入 Pod 排查 DNS/网络/依赖问题。
一步步上线 Kubernetes NetworkPolicy:先做默认拒绝,再放行 DNS 和关键依赖,避免策略一上就把业务打挂。
不用供应商小时单价拍脑袋,按有效 GPU 小时、冷启动、闲置、运维和 SLO 计算 Serverless 与独占 GPU 的盈亏平衡点,并设计混合容量迁移路径。
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
从真实故障出发理解 Liveness、Readiness 和 Startup Probe 的职责边界,避免误探测导致重启和流量异常。
通过可复现程序和 /proc、strace 观察 glibc malloc 如何使用 brk、mmap、madvise,以及 free 后 RSS 为何不一定下降。
在不把 curl/dig/tcpdump 打进生产镜像的前提下,安全地进入 Pod 排查 DNS/网络/依赖问题。
一步步上线 Kubernetes NetworkPolicy:先做默认拒绝,再放行 DNS 和关键依赖,避免策略一上就把业务打挂。
不用供应商小时单价拍脑袋,按有效 GPU 小时、冷启动、闲置、运维和 SLO 计算 Serverless 与独占 GPU 的盈亏平衡点,并设计混合容量迁移路径。
把 Deployment 滚动升级参数与 PodDisruptionBudget 配合起来,降低发布与节点维护带来的可用性风险。
使用 LWS DisaggregatedSet 管理 Prefill/Decode 角色,给出 SGLang 和 vLLM 的 NIXL 启动参数、Kubernetes 发布骨架、路由验证与生产边界。
从 Kubernetes GPU 资源语义出发,对比队列回填、NVIDIA Time-Slicing、MIG 和运行时共享,并给出可执行配置、验证指标与回滚边界。
把 CPU/内存 requests 与 limits 讲清楚:调度、限流、OOMKilled、QoS、HPA/VPA 与容量规划。
用可复现的 C 程序和 GDB 实验拆解 SysV AMD64 参数传递、call/ret、栈帧、回溯、PIE 地址定位与优化影响。
从生产安全角度讲清 Kubernetes RBAC 最小权限设计,减少过宽授权、滥用 cluster-admin 和误绑风险。
拆开看 Linux 如何在运行时动态链接共享库——PIC、GOT、PLT、延迟绑定、gdb 追踪,以及 -fPIC 的真实代价。
用一份可复现实验拆解 Linux 二进制加固:Stack Canary、FORTIFY、NX、Stack Clash、ASLR、PIE、RELRO 与 CET 分别防什么,以及如何验证构建产物。
从 glibc malloc 的 Arena、Chunk、Bin 与 Tcache 出发,用可复现实验区分真实泄漏、分配器缓存、碎片和 RSS 不回落。
基于 2026 年 9 月 3 日的项目快照,对比五个自托管 Agent 框架的部署、扩展、安全边界和运维成本。
对比 KAI-Scheduler 的 Reservation Pod 调度记账与 HAMi 的 CUDA API 层显存、算力约束,并说明它们和 MIG 硬件隔离的边界。
用几个真实场景把三者边界讲清楚:Docker 负责装箱和运行,Kubernetes 负责编排和稳定运行,OpenStack 负责把硬件变成可自助申请的云资源池。
解读 hetGPU 研究原型提出的跨厂商 GPU 二进制方案,区分论文设计、概念伪代码与当前工程能力。
从 cgroup V1/V2 差异出发,用 cpu.stat、memory.events、PSI 和 Kubernetes 资源配置定位 CPU 节流、内存回收与 OOM。
复盘 tkestack/gpu-manager 的 Device Plugin、vCUDA 资源模型、库注入和拓扑分配,并说明旧 CUDA 兼容边界与现代迁移方案。
用结构、示例与工具把 ELF 的类型、布局、重定位和动态链接串起来。
用可复用的流程诊断 Pending、CrashLoopBackOff、流量不通、DNS/网络和节点问题,把 Kubernetes 排障从拍脑袋变成可验证。
把 requests 写对、HPA 行为调稳、VPA 做推荐、CA 能补容量,让扩缩容可预测而不是“抽风”。
从原理到实践理解 Kubernetes 三类探针,避免误配置导致重启风暴、流量误摘除和启动失败。
通过 Helm 快速部署 MySQL 集群,同时理解 Chart 默认值、持久化、网络与生产环境中的关键权衡。
讲清 kubectl port-forward 的工作原理、适用调试场景,以及它和 Service、Ingress 的区别。
理解 MySQL 源库与副本在 Kubernetes 中的部署结构,使用 MySQL 8.4 命令检查复制状态、路由和故障切换。
理解 Headless Service 为什么适合 StatefulSet、数据库和服务发现,以及它与普通 Service 的关键差异。
讲清 StatefulSet 为什么适合数据库和中间件,以及稳定网络标识、有序伸缩和持久存储的实际意义。