Empresa: Brasilseg
Atuará também no desenvolvimento de soluções internas utilizando Python e/ou Java, integrando plataformas de dados com ferramentas de monitoramento e observabilidade, assegurando qualidade, disponibilidade, rastreabilidade e rápida detecção de falhas em pipelines e sistemas, com forte atuação em ambientes cloud (AWS). O que é importante você ter? O que estará sobre seus cuidados 1-Diagnóstico, Sustentação e Resiliência • Atuar como segundo nível de suporte (N2) no diagnóstico e na resolução de incidentes complexos de produção. • Analisar criticamente a infraesturtura e o comportamento das aplicações para identificar fragilidades arquiteturais e pontos únicos de falha (SPOFs) • Liderar e participar ativamente de análises de causa raiz (RCA - Post-mortems) de incidentes críticos, propondo e implementando melhorias definitivas. • Garantir a alta disponibilidade, escalabilidade e resiliência dos sistemas mapeados. • Aplicar práticas consolidadadas de SRE e engenharia de resiliência nos ambientes operacionais. 2. Observabilidade de Sistemas Fim a Fim • Projetar e implementar estratégias de observabilidade integrando os três pilares fundamentais: métricas, logs e tracing distribuído. • Garantir a rastreabilidade ponta a ponta de fluxos de requisições que cruzam diferentes microsserviços, plataformas de dados e APIs. • Desenvolver e manter dashboards consolidados e sistemas de alertas inteligentes para rápida detecção de anomalias, degradação de performance e latência. • Definir, monitorar e garantir o cumprimento de acordos e indicadores de níveis de serviço, tais como SLAs, SLOs e SLIs das aplicações críticas para o negócio. 3. Engenharia de Soluções e Automação de Monitoramento • Desenvolver e customizar ferramentas internas, scripts e novos exportadores de telemetria utilizando linguagens como Python e/ou Java. • Automatizar processos de infraestrutura, deploys e configurações de monitoramento via esteiras de CI/CD (GitHub Actions) • Integrar sistemas de mensageria e processamentos de eventos (como SQS) a ecossistemas de alertas operacionais e auto-recuperação (self-healing) • Trabalhar e evoluir ferramentas de mercado e de código aberto como Datadog, Grafana, Prometheus e AWS CloudWatch. 4. Catalogação, Governança e Melhores Práticas • Estruturar e manter a catalogação de aplicações e serviços, garantindo a governança sobre a propriedade (ownership), dependências e topologia de sistemas. • Documentar arquiteturas de monitoramento, guias de incidentes (runbooks), métricas de performance e tolopogia de redes/aplicações. • Disseminar a cultura de SRE, mentalidade de automação e práticas de observabilidade nativa com os times de engenharia de software e desenvolvimento. • Apoiar a definição e evolução dos padrões corporativos de arquitetura resiliente e monitoramento. Requisitos: Requisitos e qualificações • Formação superior completa em Ciência da Computação, Engenharia de Software, Sistemas de Informação ou áreas correlatas. • Conhecimento em Implementação de observabilidade avançada (métricas, log e tracing) • Conhecimento em Desenvolvimento de automações utilizando Python ou Java • Conhecimento em Operação e sustentação em núvem pública (AWS)- • Conhecimento em Engenharia de dados Sobre a empresa: O que estará sobre seus cuidados: Profissional especializado em engenharia de dados com forte atuação em monitoramento e observabilidade, responsável por projetar, desenvolver e sustentar pipelines de dados escaláveis, confiáveis e monitoráveis, garantindo visibilidade ponta a ponta dos fluxos de dados. Este engenheiro deve possuir uma visão holística e profunda da arquitetura de sistemas, sendo capaz de rastrear fluxos complexos para identificar fragilidades, gargalos e causas de falhas estruturais em aplicações. Além da atuação reativa e preventiva em incidentes, será responsável por projetar novas soluções de telemetria, automação e catalogação de aplicações, elevando a maturidade operacional e a governança do ecossistema tecnológico