Empresa: craftech
A Craf Tech é uma empresa de tecnologia especializada em conectar talentos a grandes desafios, impulsionando transformação e inovação por meio de pessoas. Acreditamos que ambientes diversos e colaborativos geram melhores ideias, relações mais saudáveis e resultados mais consistentes. Por isso, valorizamos diferentes trajetórias, experiências e perspectivas, promovendo um espaço respeitoso , inclusivo e acolhedor para todas as pessoas. Mais do que desenvolver soluções em tecnologia , buscamos criar oportunidades para crescimento, troca de conhecimento e impacto real por meio da inovação. Se você procura um ambiente para evoluir, contribuir e construir o futuro junto com a gente, queremos conhecer você 💙 Se você se identifica com este desafio, confira as principais responsabilidades da vaga: Engenharia de dados (execução) Projetar, construir e manter pipelines de ingestão e transformação orquestrados em Apache Airflow, com padrões consistentes de retry, idempotência, alerta e SLA. Desenvolver e evoluir modelos de transformação em dbt sobre o data warehouse, organizando as camadas (staging → intermediate → marts) com testes e documentação. Implementar ingestões de fontes heterogêneas: bancos transacionais, APIs de terceiros (custodiantes, distribuidores, provedores de mercado), arquivos regulatórios e planilhas operacionais. Instrumentar observabilidade dos dados: freshness, volumetria, quebras de contrato, reconciliação entre origem e destino. Arquitetura e modelagem Definir e defender o modelo de dados do warehouse (dimensional, Data Vault ou híbrido — com justificativa), incluindo chaves, granularidade, historização (SCD) e tratamento de correções retroativas. Estabelecer padrões de distribuição, ordenação e particionamento no MPP (DISTKEY, SORTKEY, compressão em Redshift; equivalentes em outras engines) e garantir que sejam seguidos. Fazer o desenho de camadas e contratos de dados entre times: o que é fonte da verdade, quem pode escrever onde, o que é exposto para BI e o que é interno. Conduzir tuning de performance e custo: análise de planos, filas/WLM, concorrência, manutenção (VACUUM/ANALYZE ou equivalente), rewrite de queries e materializações. Avaliar e recomendar tecnologias (formatos de tabela, lakehouse, streaming, catálogo, ferramentas de qualidade) com análise de trade-off explícita, incluindo custo e custo de saída. Governança, qualidade e regulatório Implementar controles de qualidade automatizados e reconciliações que sustentem números usados em relatórios a clientes e em respostas a reguladores. Garantir linhagem e rastreabilidade ponta a ponta: de um número no painel até a origem e a versão do código que o produziu. Aplicar controles de acesso, segregação por sensibilidade e conformidade com LGPD e com as normas aplicáveis ao setor (CVM, BACEN, BSM, políticas internas de compliance). Documentar decisões arquiteturais (ADRs) e manter o dicionário de dados vivo. Requisitos: Ensino superior completo SQL avançado de verdade: window functions, CTEs recursivas, leitura de plano de execução, diagnóstico de skew e de spill em disco. Python para engenharia de dados: código modular, testável e versionado (não apenas notebooks). Familiaridade com pandas/polars, tipagem e testes automatizados. Apache Airflow em produção: autoria de DAGs, sensores, backfill, gestão de dependências e de falhas. Data warehouse MPP em nuvem — Redshift preferencialmente; Snowflake, BigQuery ou Databricks são aceitos com disposição para se aprofundar em Redshift. dbt ou ferramenta equivalente de transformação versionada, com testes. Modelagem dimensional (Kimball) com domínio real: fato vs. dimensão, granularidade, SCD tipos 1/2, tabelas ponte, snapshots. Git e cultura de code review; CI/CD aplicado a dados. Modelagem e diagnóstico de performance: você sabe explicar por que uma query está lenta e provar a correção com números antes e depois. Experiência no mercado financeiro (diferencial)