Empresa: GFT Technologies
O que buscamos? Um(a) Engenheiro(a) de Dados Sênior para atuar com desenvolvimento e arquitetura de plataformas de dados. A posição envolve a construção e operação de pipelines, bem como a responsabilidade arquitetural sobre a plataforma, incluindo modelagem de data Lake, padrões de ingestão, governança de camadas e otimização de performance e custo. É essencial a execução técnica, com foco na confiabilidade dos dados que suportam painéis executivos, relatórios e obrigações regulatórias em um ambiente regulado, exigindo rastreabilidade e reprodutibilidade. Responsabilidades: • Saber trabalhar na estrutura de hub-spoke • Projetar, construir e manter pipelines de ingestão e transformação orquestrados em Apache Airflow, com padrões consistentes de retry, idempotência, alerta e SLA. • Desenvolver e evoluir modelos de transformação em dbt sobre o data warehouse, organizando as camadas (staging → intermediate → marts) com testes e documentação. • Implementar ingestões de fontes heterogêneas: bancos transacionais, APIs de terceiros (custodiantes, distribuidores, provedores de mercado), arquivos regulatórios e planilhas operacionais. • Instrumentar observabilidade dos dados: freshness, volumetria, quebras de contrato, reconciliação entre origem e destino. • Definir e defender o modelo de dados do warehouse (dimensional, Data Vault ou híbrido — com justificativa), incluindo chaves, granularidade, historização (SCD) e tratamento de correções retroativas. • Estabelecer padrões de distribuição, ordenação e particionamento no MPP (DISTKEY, SORTKEY, compressão em Redshift; equivalentes em outras engines) e garantir que sejam seguidos. • Fazer o desenho de camadas e contratos de dados entre times: o que é fonte da verdade, quem pode escrever onde, o que é exposto para BI e o que é interno. • Conduzir tuning de performance e custo: análise de planos, filas/WLM, concorrência, manutenção (VACUUM/ANALYZE ou equivalente), rewrite de queries e materializações. • Avaliar e recomendar tecnologias (formatos de tabela, lakehouse, streaming, catálogo, ferramentas de qualidade) com análise de trade-off explícita, incluindo custo e custo de saída. • Trabalhar com dados vetorizados • Implementar controles de qualidade automatizados e reconciliações que sustentem números usados em relatórios a clientes e em respostas a reguladores. • Garantir linhagem e rastreabilidade ponta a ponta: de um número no painel até a origem e a versão do código que o produziu. • Aplicar controles de acesso, segregação por sensibilidade e conformidade com LGPD e com as normas aplicáveis ao setor (CVM, BACEN, BSM, políticas internas de compliance). • Documentar decisões arquiteturais (ADRs) e manter o dicionário de dados vivo. • Atuar como referência técnica para engenheiros(as) pleno e júnior: code review, pareamento, definição de padrões e mentoria. • Traduzir demandas de negócio (Wealth Management, Comercial, Risco, Compliance, Operações) em desenho de dados sustentável — inclusive dizendo "não" a atalhos que criam dívida. • Participar do planejamento técnico e estimar com honestidade escopo, risco e prazo. Requisitos obrigatórios: • Experiencia comprovada em engenharia de dados com responsabilidade arquitetural (saber desenhar o modelo, não só implementar de outra pessoa). • Histórico comprovado de ter levado ao ar e operado em produção uma plataforma de dados analítica — com incidentes, plantão e consequências reais. • SQL avançado de verdade: window functions, CTEs recursivas, leitura de plano de execução, diagnóstico de skew e de spill em disco. • Python para engenharia de dados: código modular, testável e versionado (não apenas notebooks). • Familiaridade com pandas/polars, tipagem e testes automatizados. • Apache Airflow em produção: autoria de DAGs, sensores, backfill, gestão de dependências e de falhas. • Data warehouse MPP em nuvem — Redshift preferencialmente; Snowflake, BigQuery ou Databricks são aceitos com disposição para se aprofundar em Redshift. • DBT ou ferramenta equivalente de transformação versionada, com testes. • Modelagem dimensional (Kimball) com domínio real: fato vs. dimensão, granularidade, SCD tipos 1/2, tabelas ponte, snapshots. • Git e cultura de code review; CI/CD aplicado a dados. • Modelagem e diagnóstico de performance: saber explicar por que uma query está lenta e provar a correção com números antes e depois. • Rigor com correção numérica. • Comunicação escrita clara/documentação. • • Autonomia para investigar do dashboard até a origem sem pedir permissão a cada passo. • • Disponibilidade de atuação hibrida 2 a 3x presencial - Região Vila Olimpia Diferenciais (desejáveis): • Experiência no mercado financeiro: investimentos, wealth management, custódia, renda fixa/variável, fundos, cálculo de rentabilidade (TIR/TWR), posição e movimentação. • Vivência com dados regulatórios: CVM, BACEN, BSM, ANBIMA — inclusive prazos e formatos de entrega. • Infra como código (Terraform), AWS (S3, Glue, Lambda, IAM, Step Functions). • Formatos de tabela abertos (Iceberg, Delta) e arquitetura lakehouse. • Streaming / CDC (Kafka, Debezium, Kinesis). • Ferramentas de qualidade e catálogo (Great Expectations, Soda, DataHub, OpenMetadata). • Experiência com camada semântica e ferramentas de BI (Power BI, Metabase, Looker). • • Ter conduzido uma migração relevante (legado → moderno, on-prem → nuvem, ou planilha/VBA → pipeline versionado) com validação de paridade. • Descrição comportamental: • Procuramos uma pessoa que: • Goste de trabalhar em equipe e seja colaborativa em suas atribuições; • Tenha coragem para se desafiar e ir além, abraçando novas oportunidades de crescimento; • Transforme ideias em soluções criativas e busque qualidade em toda sua rotina; • Tenha habilidades de resolução de problemas ; • Possua habilidade e se sinta confortável para trabalhar de forma independente e gerenciar o próprio tempo ; • Tenha interesse em lidar com situações adversas e inovadoras no âmbito tecnológico. • Big enough to deliver – small enough to care. • #VempraGFT • #LetsGoBeyond • #ProudToBeGFT