Site Reliability Engineer (SRE)

Empresa: Mazzatech

Requisitos: • Inglês avançado/fluente. • Bacharelado em Ciência da Computação, Engenharia ou áreas correlatas. • Sólida experiência em Site Reliability Engineering (SRE) • DevOps • Infraestrutura • Cloud Engineering • Experiência prática com AWS, Azure ou GCP • Terraform (preferencial) • Docker • Kubernetes • CI/CD • Python ou Bash • Linux/Unix • Monitoramento e observabilidade • Gestão de incidentes • Diferencial: • Experiência em ambientes de grande escala. • Vivência em consultorias. • Experiência com Chaos Engineering. • Experiência com arquiteturas altamente distribuídas. • Forte background em observabilidade. • Conhecimento avançado em Kafka. • Experiência em plataformas financeiras ou ambientes críticos. • Tempo: indeterminado • Local: hibrida ou remota Sobre a empresa: Será responsável por garantir a confiabilidade e eficiência operacional dos ambientes através de automação, observabilidade e boas práticas de engenharia. Automação e Eficiência Operacional Automatizar processos operacionais, deploys e provisionamento. Desenvolver scripts e ferramentas internas (Python, Bash, etc.). Implementar e evoluir pipelines CI/CD. Reduzir atividades manuais e operacionais repetitivas. Infraestrutura Cloud e IaC Provisionar e manter ambientes em nuvem. Trabalhar com Infrastructure as Code (Terraform, CloudFormation). Garantir escalabilidade e alta disponibilidade. Implementar estratégias de auto-scaling e self-healing. Confiabilidade e Performance Monitorar sistemas através de métricas, logs e traces. Definir e acompanhar SLIs, SLOs e SLAs. Executar capacity planning. Realizar troubleshooting e otimização de performance. Gestão de Incidentes Atuar em incidentes críticos de produção. Conduzir análises de causa raiz (RCA). Desenvolver planos de melhoria contínua. Observabilidade Implementar ferramentas de monitoramento e alertas. Criar dashboards operacionais. Aumentar a visibilidade end-to-end dos sistemas. Engenharia de Plataforma Trabalhar em conjunto com times de desenvolvimento. Apoiar práticas DevOps e SRE. Melhorar arquitetura, deploys e resiliência das aplicações. Continuidade de Negócios Disaster Recovery. Testes de carga e stress. Chaos Engineering. Estratégias de resiliência operacional. Governança e Boas Práticas Definir padrões operacionais. Documentar processos e arquiteturas. Aplicar práticas de segurança e DevSecOps.

Ver todas as vagas