Kubernetes 探针:存活、就绪、启动和故障信号
从真实故障出发理解 Liveness、Readiness 和 Startup Probe 的职责边界,避免误探测导致重启和流量异常。
Kubernetes 收录 35 篇实战文章,覆盖配置方法、故障排查与生产决策。
从真实故障出发理解 Liveness、Readiness 和 Startup Probe 的职责边界,避免误探测导致重启和流量异常。
在不把 curl/dig/tcpdump 打进生产镜像的前提下,安全地进入 Pod 排查 DNS/网络/依赖问题。
一步步上线 Kubernetes NetworkPolicy:先做默认拒绝,再放行 DNS 和关键依赖,避免策略一上就把业务打挂。
把 Deployment 滚动升级参数与 PodDisruptionBudget 配合起来,降低发布与节点维护带来的可用性风险。
使用 LWS DisaggregatedSet 管理 Prefill/Decode 角色,给出 SGLang 和 vLLM 的 NIXL 启动参数、Kubernetes 发布骨架、路由验证与生产边界。
把 CPU/内存 requests 与 limits 讲清楚:调度、限流、OOMKilled、QoS、HPA/VPA 与容量规划。
按时间倒序查看这个分类下的全部文章。
用 Minikube 在本地快速启动一个可反复实验的 Kubernetes 单节点集群,适合学习、验证 YAML 和调试基础工作流。
从产品与工程视角理解 Kubernetes 的价值边界,搞懂它为什么适合现代服务部署、扩缩容与持续运维。
从 API Server、Scheduler、Controller Manager 到 kubelet,按链路理解 Kubernetes 控制平面、工作节点与对账机制。
按正确顺序学习 Kubernetes:先概念、再工作负载、再网络存储与排障,避免知识点碎片化。
从 Kubernetes 的对账和失败方式理解 Pod、Deployment、Service 和 Namespace,再用真实命令验证每次变更。