Senior Platform SRE
- Hiring Organisation
- Appcast
- Location
- Remote, UK
reliability platform Implement comprehensive monitoring and observability using OpenTelemetry and distributed tracing. Maintain SLO, error budgets and burn-rate tracking Establish and maintain 24 / 7 operational readiness including automated deployments, blue / green releases, and zero-downtime patching strategies Engineer self-healing capabilities: auto-remediation, error-budget … chaos experiments across the AWS estate, turning severe-but-plausible failure scenarios into engineering improvements Build automation tools and CI / CD pipelines that embed reliability practices, while applying software engineering discipline including version control, code reviews, and testing. Contribute to the SRE AI agent ...