基于 sgl-project/rbg 的 PD 分离推理部署实践
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
用 RoleBasedGroup 把 SGLang Prefill/Decode 分离部署成一个可整体运维的单元:路由、启动依赖、多机 TP、KV 传输与灰度升级的落地方案。
从真实故障出发理解 Liveness、Readiness 和 Startup Probe 的职责边界,避免误探测导致重启和流量异常。
通过可复现程序和 /proc、strace 观察 glibc malloc 如何使用 brk、mmap、madvise,以及 free 后 RSS 为何不一定下降。
在不把 curl/dig/tcpdump 打进生产镜像的前提下,安全地进入 Pod 排查 DNS/网络/依赖问题。
一步步上线 Kubernetes NetworkPolicy:先做默认拒绝,再放行 DNS 和关键依赖,避免策略一上就把业务打挂。
不用供应商小时单价拍脑袋,按有效 GPU 小时、冷启动、闲置、运维和 SLO 计算 Serverless 与独占 GPU 的盈亏平衡点,并设计混合容量迁移路径。
理解 StorageClass 如何驱动动态供给,默认 StorageClass 有什么影响,以及如何选择合适的存储策略。
理解 PersistentVolume 与 PersistentVolumeClaim 的绑定关系、生命周期以及 Kubernetes 存储排障思路。
用 emptyDir、内存盘和 Generic Ephemeral Volume 处理缓存、构建空间和 sidecar 共享数据,并理解调度、驱逐和清理边界。
从 emptyDir 到持久卷,理解 Kubernetes 常见 Volume 类型、数据是否持久,以及不同场景下的选型方式。
讲清 ConfigMap 与 Secret 的使用边界、挂载方式与安全注意事项,减少配置漂移和敏感信息泄露风险。
从单实例 MySQL 的角度讲清 Kubernetes 上数据库部署的基本做法,包括 StatefulSet、持久卷和 Service 访问。
从数据库和消息系统等场景出发,理解 Kubernetes 上有状态应用的部署方式、风险点与运维重点。
理解 Kubernetes 中常见的金丝雀发布思路、流量验证方法与回滚策略,降低发布风险。
从 desired state 出发理解 Kubernetes 声明式配置,讲清 apply、配置漂移与持续对账在实际运维中的意义。
搞懂 Namespace 在 Kubernetes 中如何组织资源、隔离环境、配合配额与权限控制支持多团队协作。
按链路理解 Service 如何为 Pod 提供稳定访问入口,并掌握 ClusterIP、NodePort、LoadBalancer 的区别与排障方法。
搞懂 Deployment 与 ReplicaSet 的关系、滚动更新流程,以及发布失败时应如何定位和回滚。
从容器编排视角理解 Pod 的本质、生命周期、重启机制与常见排障命令,打牢 Kubernetes 基础。
理解 K3s 与标准 Kubernetes 的差异,快速完成安装,并用它搭建轻量实验或边缘计算环境。
用 Minikube 在本地快速启动一个可反复实验的 Kubernetes 单节点集群,适合学习、验证 YAML 和调试基础工作流。
从产品与工程视角理解 Kubernetes 的价值边界,搞懂它为什么适合现代服务部署、扩缩容与持续运维。
从 API Server、Scheduler、Controller Manager 到 kubelet,按链路理解 Kubernetes 控制平面、工作节点与对账机制。
按正确顺序学习 Kubernetes:先概念、再工作负载、再网络存储与排障,避免知识点碎片化。
从 Kubernetes 的对账和失败方式理解 Pod、Deployment、Service 和 Namespace,再用真实命令验证每次变更。