Empresa: Serasa Experian
Estamos em busca de uma Site Reliability Engineer (SRE) Plena altamente motivada para integrar nossa equipe de Cloud, Data & AI Platform . Nesta função, você será responsável por projetar, operar e aprimorar continuamente a confiabilidade, escalabilidade, observabilidade e desempenho de plataformas cloud-native que suportam aplicações críticas para o negócio, pipelines de dados e cargas de trabalho de IA/ML. Você trabalhará em estreita colaboração com as equipes de Engenharia de Software, Engenharia de Dados, Engenharia de IA e Plataforma para criar sistemas resilientes, automatizar operações, melhorar a experiência dos desenvolvedores e estabelecer as melhores práticas de confiabilidade em toda a organização. Como engenheira plena, você desempenhará um papel fundamental no avanço da excelência operacional por meio de automação, observabilidade, gestão de incidentes, otimização de custos e modernização da infraestrutura. Principais Responsabilidades: • Projetar e operar plataformas em nuvem altamente disponíveis, escaláveis e seguras na AWS. • Construir e manter infraestrutura baseada em Kubernetes para suportar aplicações, dados e cargas de trabalho de IA. • Melhorar a confiabilidade da plataforma por meio de automação, Infraestrutura como Código (IaC) e recursos de autoatendimento (self-service). • Implementar e aprimorar soluções de observabilidade utilizando Datadog, incluindo monitoramento, logs, rastreamento (tracing), alertas, dashboards e gestão de SLOs. • Suportar e otimizar ambientes de processamento de dados em larga escala utilizando Airflow, Amazon EMR, S3 e outros serviços de dados da AWS. • Trabalhar em parceria com as equipes de Dados e IA para melhorar a confiabilidade, escalabilidade e maturidade operacional de plataformas de Machine Learning e Inteligência Artificial. • Liderar atividades de resposta a incidentes, análises de causa raiz e revisões pós-incidente, promovendo a melhoria contínua. • Definir e medir Indicadores de Nível de Serviço (SLIs), Objetivos de Nível de Serviço (SLOs) e orçamentos de erro (error budgets). • Aprimorar processos de implantação, pipelines de CI/CD e a confiabilidade das releases. • Otimizar a utilização, desempenho e custos da infraestrutura em nuvem. • Mentorar membros da equipe e promover as melhores práticas de SRE em toda a organização de engenharia. • O que define o sucesso nessa função • Aumento da disponibilidade e confiabilidade da plataforma. • Melhoria da observabilidade e redução do tempo de resolução de incidentes. • Maior automação e redução de esforços operacionais manuais e repetitivos. • Plataformas de Dados e IA confiáveis, escaláveis e com eficiência de custos. • Forte colaboração com as equipes de Engenharia para entregar sistemas de produção resilientes. • Qualifications • Qualificações obrigatórias • Ensino Superior cursando/completo. • Experiência sólida em Site Reliability Engineering, Platform Engineering, Cloud Engineering ou funções de DevOps. • Forte experiência prática com serviços AWS e arquiteturas cloud-native. • Conhecimento profundo de Kubernetes e workloads conteinerizadas em ambientes de produção. • Experiência na gestão e resolução de problemas em sistemas distribuídos de grande escala. • Sólida experiência com plataformas de observabilidade, preferencialmente Datadog. • Experiência no suporte a plataformas e fluxos de dados utilizando tecnologias como Airflow, EMR, Spark e S3. • Expertise em Infraestrutura como Código (IaC) utilizando Terraform ou ferramentas similares. • Experiência na construção e manutenção de pipelines de CI/CD e automação de plataformas. • Sólidos conhecimentos em Linux, redes e troubleshooting de desempenho de sistemas. • Proficiência em scripts e automação utilizando Python, Bash ou linguagens similares. • Qualificações desejáveis • Experiência no suporte a plataformas cloud-native de grande escala em ambientes AWS. • Experiência com operações de plataformas Kubernetes e gerenciamento do ciclo de vida de clusters. • Conhecimento dos princípios de Site Reliability Engineering, incluindo SLOs, SLIs, error budgets e práticas de excelência operacional. • Experiência na implementação de soluções de observabilidade utilizando ferramentas como Datadog, Prometheus, Grafana, OpenTelemetry ou tecnologias similares. • Familiaridade com plataformas de processamento de dados e orquestração de workflows, como Airflow, Spark ou EMR. • Experiência com Infraestrutura como Código (IaC) e práticas de automação de plataformas. • Certificações AWS, Kubernetes, Terraform ou Datadog. • Experiência atuando em ambientes corporativos de grande escala, altamente disponíveis ou de missão crítica. • Inglês técnico intermediário. • Additional Information • Esta é uma posição afirmativa para mulheres, como parte do nosso compromisso com o avanço da equidade de gênero no ambiente de trabalho. • A Serasa Experian investe na liderança feminina e possui a parceria com a TODAS Group. Além disso, aderimos ao Movimento 'Elas Lideram 2030’, e nos unimos à ONU Mulheres para reduzir a desigualdade de gênero até 2030!! • Temos também o grupo Women in Experian que busca melhorar a equidade de gênero para mulheres, criando oportunidades de desenvolvimento, diferentes perspectivas, habilidades, entre outros. • Venha fazer parte dessa transformação! • Caso você não se identifique com este grupo, convidamos você a explorar outras oportunidades em nossa página de carreiras. Temos diversas vagas que podem se conectar com seu perfil e interesses. • #LI-HOME • Experian Careers - Creating a better tomorrow together • Find out what its like to work for Experian by clicking here Sobre a empresa: Job Description