guardrails Support shared and dedicated cluster patterns, including tenant onboarding Improve platform performance under production conditions (e.g. scaling, storage, node pressure) Build automation-first infrastructure using Terraform, CI/CD and GitOps Simplify cluster lifecycle management (provisioning, upgrades, add-ons) Develop self-service platform capabilities to improve developer experience … Apply Site Reliability Engineering (SRE) practices to platform operations Support incident response, monitoring, observability and continuous improvement Diagnose issues across performance, scaling, storage and automation Contribute to a 24x7 on-call rotation Implement policy-as-code controls (e.g. OPA Gatekeeper, RBAC, workload identity) Support audit, compliance and risk mitigation ...