Coordenador SRE e DevOps

Empresa: Unimed CNU

Garantir a confiabilidade, disponibilidade e performance dos serviços críticos de TI, liderando a estratégia e as equipes de Site Reliability Engineering (SRE) e DevOps, com foco em automação, cultura de entrega contínua (CI/CD), observabilidade, gestão de incidentes e crises, e evolução contínua das práticas de engenharia de confiabilidade e DevOps, alinhado aos objetivos do negócio. • Definir e monitorar SLOs, SLIs e SLAs dos serviços críticos, garantindo alinhamento com as expectativas do negócio. • Liderar a análise de tendências de desempenho e disponibilidade, direcionando ações preventivas. • Garantir a implementação de sistemas de monitoramento e observabilidade abrangentes. • Disseminar a cultura DevOps na organização, promovendo a colaboração entre os times de desenvolvimento e operações. • Direcionar a evolução das esteiras de CI/CD, garantindo entregas contínuas, seguras e com qualidade. • Direcionar a evolução da cultura de Infrastructure as Code (IaC) e automação de processos operacionais. • Promover práticas de GitOps e estratégias de deployment (blue-green, canary releases) para reduzir riscos em produção. • Priorizar o desenvolvimento de ferramentas e frameworks de automação da equipe. • Avaliar e aprovar a adoção de novas tecnologias e práticas de SRE e DevOps. • Atuar como ponto focal executivo em incidentes críticos e situações de crise, coordenando comunicação com stakeholders e liderança. • Garantir a realização de post-mortems estruturados e a implementação efetiva dos planos de ação. • Manter atualizados os processos de gestão de crise, incluindo classificação de severidade e fluxos de escalonamento. • Liderar, desenvolver e avaliar as equipes de SRE e DevOps, definindo planos de carreira, capacitação e certificações. • Planejar, distribuir e priorizar demandas das equipes, equilibrando capacidade, qualidade e prazos. • Promover a cultura de melhoria contínua, feedback e compartilhamento de conhecimento. • Gerenciar o orçamento da área (OPEX/CAPEX) relacionado a ferramentas de observabilidade, automação e CI/CD. • Acompanhar e validar KPIs, SLAs e OLAs de fornecedores críticos, promovendo ações corretivas quando necessário. • Apoiar a definição de requisitos técnicos e operacionais em processos de contratação e renovação de contratos. • Consolidar indicadores técnicos (KPIs) das áreas de SRE e DevOps em relatórios gerenciais para a liderança. • Participar do Comitê de Mudanças (CAB), avaliando riscos e impactos de mudanças críticas. • Representar as áreas de SRE e DevOps em fóruns de arquitetura, segurança e continuidade de negócio. • Cumprir o regulamento interno, os requisitos dos sistemas de gestão da qualidade, observação e cumprimento das regulamentações da ANS, bem como das normas e procedimentos de saúde, higiene e segurança do trabalho inerentes ao setor. • Desenvolver outras atividades inerentes ao cargo ou a critério de seu superior imediato, desde que habilitado e estejam de acordo com o seu conhecimento e experiência. Requisitos: • Superior completo em Ciências de Computação, Sistemas de Informação ou outros equivalentes na área de Tecnologia, pós graduação, especialização ou MBA em áreas correlatas. • Experiência com monitoramento de SLOs/SLIs/SLAs; automação e Infrastructure as Code (Terraform, Ansible); ferramentas de monitoramento e observabilidade (Datadog, Prometheus, Grafana, ELK); esteiras de CI/CD (Jenkins, GitLab CI, GitHub Actions); containers e orquestração (Docker, Kubernetes); práticas de GitOps (ArgoCD, Flux); cultura e metodologias DevOps; gestão de incidentes e crises; liderança técnica e gestão de equipes. • Certificações diferenciais: AWS/Azure/GCP (Cloud, SRE ou DevOps Engineer); ITIL; COBIT; Certified Kubernetes Administrator (CKA); Certified DevOps Engineer.

Ver todas as vagas