获取验证码
Supervisor Cluster(主管集群)是vSphere with Kubernetes(Tanzu)的核心K8s控制平面,以特殊控制平面虚拟机形式运行在ESXi集群之上。它打通vSphere虚拟化层与Kubernetes容器层,原生集成vCenter资源调度、存储、网络、权限体系。Supervisor集群本身既是K8s控制层,可直接运行容器Pod;同时支持创建多套独立TKG Guest Cluster(客户集群),统一管控所有容器工作负载,是虚拟化平台落地Tanzu容器能力的基础底座。
有VMware全系列产品官方资源和定制版资源需求的可以移步:
初期部署vSphere with Kubernetes时混淆Supervisor Cluster与TKG Guest Cluster,直接尝试在Guest集群中配置存储策略、网络策略,多次配置不生效。运维误以为Guest集群拥有完整资源管控权限,不清楚存储、vDS网络、虚拟机资源调度权限由Supervisor统一管控。 1.1 初期无效排查操作
反复调整TKG Guest集群内部yaml配置,尝试直接访问底层ESXi硬件资源,持续报错权限不足;直接在Guest集群创建持久化存储,无法识别vSphere存储策略。
1.2 分层定位真实故障根因
TKG Guest Cluster属于下层工作集群,不具备调度虚拟化底层资源的权限。所有访问vSphere基础设施的请求,都需要由上层Supervisor Cluster接收并代理执行。存储策略、容器网络、虚拟机生命周期、身份认证均由Supervisor统一管理。 现场验证修复:先在Supervisor集群完成存储策略、网络配置,再下发至下游TKG集群,容器持久卷、网络策略正常生效。
1、部署形态
由3台Control Plane VM(控制平面虚拟机)组成高可用集群,部署在启用vSphere with Kubernetes的ESXi集群中;使用vSphere DRS、HA保障控制平面高可用,依赖vCenter完成生命周期运维。
2、核心定位
Supervisor就是运行在虚拟化平台上的Kubernetes控制层,充当vSphere和容器工作负载中间枢纽。拥有两类工作负载承载能力:直接运行Supervisor Namespace内Pod;按需创建独立隔离的TKG Guest集群。
3、和TKG Guest Cluster层级关系
Supervisor Cluster = 父集群(主管集群);TKG Guest Cluster = 子集群(客户工作集群)。多个Guest集群受同一个Supervisor管控,Guest集群对外提供业务容器服务,基础设施资源调度交由Supervisor代理。
4、内置能力
原生支持vSphere CSI容器存储、NSX-T容器网络、基于vCenter的RBAC权限、虚拟机和容器统一监控、Tanzu Service Mesh对接、虚拟机Pod混合调度。
1、什么时候直接使用Supervisor命名空间运行Pod
轻量容器业务,集群数量少,不需要独立K8s控制平面;追求资源精简,无需单独维护多套K8s集群。
2、什么时候创建独立TKG Guest Cluster
多业务隔离需求、多团队运维、需要独立K8s版本、独立插件管理;生产业务推荐采用Guest集群隔离工作负载。
3、平台硬性约束
一套vSphere集群仅能部署一套Supervisor Cluster;无法在同一个vSphere集群部署多个主管集群。如需隔离,通过命名空间或者新建TKG Guest集群实现。
容器网络CRD资源需要在Supervisor完成配置下发
| 故障现象 | 根因分析 | 标准解决方案 |
|---|---|---|
| TKG Guest集群无法创建PV持久卷,找不到vSphere存储策略 | 存储策略仅在Supervisor集群层面注册,未同步至下游集群 | 在Supervisor命名空间绑定存储策略,通过StorageClass下发至Guest集群 |
| 登录TKG集群,无法查看底层ESXi、虚拟机资源信息 | Guest集群不具备虚拟化基础设施访问权限,权限收拢于Supervisor | 通过Supervisor集群执行底层资源相关运维操作 |
| 尝试在集群新建第二套Supervisor,部署向导无法执行 | 单个vSphere集群仅支持唯一一套Supervisor Cluster | 利用命名空间隔离或者部署TKG Guest集群实现业务隔离 |
| Supervisor集群Control Plane VM关机,所有TKG集群容器调度异常 | 所有Guest集群的调度请求依赖Supervisor控制平面 | 开启集群HA、DRS,保障3台控制平面虚拟机持续正常运行 |
| 容器Pod无法跨节点通信,NSX网络策略不生效 | 在Supervisor集群配置容器网络策略,不要直接在Guest集群创建底层网络资源 |
1. 误区:TKG Guest Cluster拥有完整独立基础设施权限纠正:Guest集群仅管理业务容器,所有虚拟化硬件资源操作必须经由Supervisor代理。
2. 误区:Supervisor Cluster只能用来创建TKG集群,不能直接运行容器纠正:Supervisor内置命名空间,可以直接部署运行容器Pod,适合轻量级应用。
3. 误区:可以在同一个vSphere集群部署多套Supervisor实现租户隔离纠正:单vSphere集群限制仅部署一套Supervisor,租户隔离使用Namespace。
4. 误区:TKG Guest集群故障不会影响Supervisor纠正:下层工作集群故障不会击穿上层Supervisor,资源天然隔离,适合多业务生产部署。
5. 误区:升级TKG Guest集群版本会同步升级Supervisor纠正:Supervisor与Guest集群版本独立升级,但存在版本兼容矩阵,升级前需要核对兼容列表。
架构规范:生产环境统一部署3节点Control Plane虚拟机实现Supervisor高可用,禁止单节点测试架构上线。
资源规范:预留充足CPU、内存、共享存储承载Supervisor控制平面,避免资源不足导致TKG集群创建失败。
运维规范:底层存储策略、容器网络、身份认证等基础设施资源,统一在Supervisor集群配置管理。
权限规范:区分Supervisor管理员权限与TKG集群用户权限,普通业务用户仅授予Guest集群访问权限。
变更规范:Supervisor版本升级属于平台级重大变更,低峰窗口执行,升级前核查所有下游TKG集群版本兼容性。