SRE Engineer - REMOTO

Empresa: verity

Responsabilidades e atribuições: • Definir e acompanhar SLIs, SLOs, SLAs, MTTR e MTTD. • Implementar observabilidade, monitoramento, alertas e APM. • Monitorar latência, tráfego, erros, saturação, disponibilidade e performance. • Atuar na prevenção, identificação e resolução de incidentes. • Conduzir análises de causa raiz e definir ações para evitar recorrências. • Identificar riscos, gargalos e pontos únicos de falha. • Apoiar o desenho de soluções resilientes, escaláveis e altamente disponíveis. • Automatizar atividades operacionais e reduzir tarefas manuais. • Operar e evoluir ambientes Kubernetes e Docker. • Apoiar estratégias de capacidade, continuidade e recuperação de desastres. • Participar de deploys e apoiar a estabilização das aplicações. • Trabalhar com os times para melhorar a confiabilidade desde a concepção das soluções. • Criar e manter dashboards, alertas, procedimentos e documentação operacional. • Promover uma cultura de confiabilidade, observabilidade e melhoria contínua. Requisitos: Experiência como Site Reliability Engineer, SRE ou função equivalente. Experiência prática com ambientes Cloud, utilizando GCP, AWS e/ou Azure. Conhecimento em Kubernetes e Docker. Experiência com observabilidade, monitoramento, alertas e APM. Conhecimento em métricas e práticas de SRE, como SLI, SLO, SLA, MTTR e MTTD. Experiência em gestão, investigação e resolução de incidentes. Conhecimento em troubleshooting de aplicações e infraestrutura. Experiência com administração de ambientes Linux. Conhecimento em redes, segurança, performance e alta disponibilidade. Experiência com automação e Infrastructure as Code. Vivência com pipelines de CI/CD. Boa comunicação e capacidade de atuar com times multidisciplinares. Perfil analítico, proativo, colaborativo e orientado à prevenção de problemas. Diferenciais: Experiência com GKE, EKS ou AKS. Conhecimento em Dynatrace, Datadog, Grafana, Prometheus ou ferramentas similares. Experiência com ELK Stack, Elasticsearch e Kibana. Conhecimento em Terraform e Ansible. Experiência com ambientes críticos e sistemas distribuídos. Vivência em instituições financeiras ou ambientes regulados. Experiência com gestão de capacidade e otimização de custos Cloud. Conhecimento em disaster recovery e continuidade de negócio. Experiência na definição e gestão de error budgets. Certificações em Cloud, Kubernetes ou SRE. Sobre a empresa: A Verity está buscando novos talentos! Somos uma consultoria de transformação e Engenharia digital e buscamos SRE Engineer para fazer parte dessa jornada. Olha só quais são as experiências e conhecimentos que você precisa ter para acelerar e transformar com a gente:

Ver todas as vagas