Empresa: Cadmus
Buscamos um(a) SRE Sênior para atuar na sustentação, evolução e engenharia de plataformas cloud em uma empresa do segmento financeiro. O profissional terá papel estratégico na construção de uma plataforma confiável, escalável, segura e automatizada, atuando próximo aos times de desenvolvimento para melhorar a disponibilidade dos serviços, reduzir riscos operacionais e acelerar o ciclo de entrega. Será responsável por implementar práticas de Site Reliability Engineering (SRE), automação, observabilidade e infraestrutura como código, contribuindo para a evolução contínua da plataforma e dos processos de desenvolvimento e deploy. Requisitos: Responsabilidades Projetar, implementar e evoluir plataformas e ambientes cloud com foco em confiabilidade, escalabilidade e segurança; Construir e manter pipelines CI/CD, promovendo automação e padronização dos processos de entrega; Provisionar e gerenciar infraestrutura utilizando Terraform e IaC; Administrar e evoluir ambientes Kubernetes; Automatizar processos de deploy, provisionamento, configuração e operações; Implementar e evoluir soluções de monitoramento, observabilidade e alertas; Definir e acompanhar SLIs, SLOs e indicadores de confiabilidade; Atuar na análise de incidentes, troubleshooting e RCA (Root Cause Analysis); Trabalhar na prevenção de incidentes e redução de problemas recorrentes; Apoiar os times de desenvolvimento na adoção de boas práticas de cloud, observabilidade, performance e confiabilidade; Evoluir padrões e componentes reutilizáveis da plataforma; Atuar na melhoria contínua da segurança e resiliência dos ambientes; Identificar oportunidades de automação e redução de atividades operacionais manuais; Contribuir para práticas de DevSecOps e FinOps; Utilizar ferramentas de IA como aceleradoras de produtividade, automação, troubleshooting e desenvolvimento. Requisitos Experiência sólida como SRE, DevOps Sênior ou Platform Engineer; AWS em ambientes produtivos; Kubernetes e Docker; Terraform e Infraestrutura como Código (IaC); Construção e manutenção de pipelines CI/CD — GitHub Actions, GitLab CI ou Jenkins; Linux e automação com Bash e/ou Python; Experiência com observabilidade e monitoramento — Prometheus, Grafana ou similares; Gestão e análise de logs — ELK, OpenSearch ou similares; Conceitos sólidos de redes, segurança e arquitetura cloud; Experiência com automação de infraestrutura, deploy e processos operacionais; Conhecimento de práticas de SRE, como disponibilidade, confiabilidade, SLIs, SLOs, SLAs, error budget e gestão de incidentes; Experiência na atuação junto a times de desenvolvimento para identificação e resolução de problemas de performance, disponibilidade e confiabilidade; Obrigatório ter experiência prática na utilização de ferramentas de IA para desenvolvimento e/ou operações, como Kiro, Claude, GitHub Copilot, ChatGPT, Cursor ou similares. Diferenciais Experiência no segmento financeiro; Conhecimento em Open Finance / Open Banking; Kafka; Helm; ArgoCD; Service Mesh — Istio ou similares; Práticas de DevSecOps; Conceitos de FinOps; Experiência com arquitetura e desenvolvimento de plataformas internas (Internal Developer Platforms); Conhecimento de GitOps; Experiência com estratégias de alta disponibilidade, disaster recovery e continuidade de serviços; Conhecimento em capacity planning e otimização de performance.