PV 绑定成功,Pod 却 ContainerCreating——存储类 mountOptions 抄错了


PV 绑定成功,Pod 却 ContainerCreating——存储类 mountOptions 抄错了 上篇讲了 CSI 驱动不启动导致 PV 创建卡住,这篇我们再来看一个不一样的存储故障——PV 创建成功、PVC 绑定了、但 Pod 就是起不来。不是资源不够,不是网络不通,是 StorageC

StorageClass 配了 PV 还 Pending?CSI 驱动没启动


StorageClass 配了 PV 还 Pending?CSI 驱动没启动 场景:应用部署创建 PVC 后 PV 一直 Pending,StorageClass 配置检查了 3 遍没问题——问题不在 YAML,在 CSI 驱动侧 路径:PVC 状态 → Events → provisioner 日

一个 emptyDir 没设 sizeLimit,整节点 30 个 Pod 全被驱逐


一个 emptyDir 没设 sizeLimit,整节点 30 个 Pod 全被驱逐 场景:Kafka Connect Pod 用 emptyDir 做 offset 存储,每天 2GB,第 3 天 /var 被吃光,同节点 30 个 Pod 全被 Evict 路径:series/series-k8

3 副本只活了 1 个——StatefulSet 启动顺序的循环死锁


3 副本只活了 1 个——StatefulSet 启动顺序的循环死锁 基于 K8s v1.25+,apps/v1 API。StatefulSet 的 podManagementPolicy 行为从 v1.7 起稳定,各版本一致 场景:3 副本分布式存储的 StatefulSet,部署后 Pod-0

Pod 起来了、PV 绑定了、挂载失败了——NFS 版本号写错一个数字


Pod 起来了、PV 绑定了、挂载失败了——NFS 版本号写错一个数字 上篇讲了 PV 删不掉——Finalizer 和 PVC Protection 锁死删除流程,这篇我们来看另一个方向的问题:PV 挂载上了,但容器里就是读不到数据。 StorageClass 配了 NFS 服务器地址和导出路径

坐标:kubectl delete pv 没报错,但 PV 还在


坐标:kubectl delete pv 没报错,但 PV 还在 上篇讲了双栈 ClusterIP 少加载内核模块导致 IPv6 不通的排查,这篇我们来看存储层一个更隐蔽的"假删"——kubectl delete pv 不报错,但 PV 对象永远删不掉。 Ceph 集群告警存储使用率 85%——"加

双栈 ClusterIP 配好了,IPv6 就是不通——少加载了一个内核模块


双栈 ClusterIP 配好了,IPv6 就是不通——少加载了一个内核模块 场景:集群升级双栈后,Service 的 IPv6 ClusterIP 永远连接超时、IPv4 正常——不是配置错了,是 kube-proxy 的 ip6tables 规则压根没写进去 路径:坐标(双栈 Service 创

双栈 Service 配置完:IPv6 秒通、IPv4 每次等 5 秒——ipFamilies 的主从陷阱


双栈 Service 配置完:IPv6 秒通、IPv4 每次等 5 秒——ipFamilies 的主从陷阱 场景:Service 配置 ipFamilyPolicy: PreferDualStack 后,IPv6 客户端秒通、IPv4 客户端每次等 5 秒才连上——不是 CNI 不支持双栈,是 ip

换了 Cilium 以后,iptables 查不到了——跨 Namespace 超时的 eBPF 排障实录


换了 Cilium 以后,iptables 查不到了——跨 Namespace 超时的 eBPF 排障实录 场景:集群从 Flannel 迁移 Cilium 后,跨 Namespace gRPC 调用间歇超时——iptables 查不到任何规则、Pod 内 tcpdump 有 SYN 无 SYN-A

一个 Pod 吃掉整节点带宽?K8s 限速 annotation 无效——TC/CNI 流量整形真相


一个 Pod 吃掉整节点带宽?K8s 限速 annotation 无效——TC/CNI 流量整形真相 场景:CI/CD Runner Pod 与生产服务混部,构建任务下载依赖占满节点出口带宽 路径:Pod 延迟确认 → 逐层追带宽(Pod→Node→CNI→tc)→ 排查命令 → annotatio