Conhecimento prático em engenharia de dados
Guias aprofundados sobre modelagem, ETL, Azure, Databricks e arquitetura de dados — escritos a partir de projetos reais.
Carga incremental no Azure Data Factory: o padrão de watermark passo a passo
Como fazer carga incremental no Azure Data Factory usando o padrão de watermark: Lookup do último valor, Copy Data só da janela nova e Stored Procedure que atualiza o controle. Guia prático.
Ler artigoData Flow do SSIS até 3× mais rápido: ajustando o buffer e o Fast Load
Como usar AutoAdjustBufferSize, DefaultBufferMaxRows e Fast Load para acelerar cargas grandes no Data Flow do SSIS. Guia prático com números reais.
Ler artigoCheckpoints no SSIS: como retomar um pacote do ponto exato da falha
Como usar os Checkpoints do SSIS para retomar um pacote longo do ponto exato da falha — as 3 propriedades de configuração, as armadilhas com Data Flow e loops, e quando (ou não) usar em 2026.
Ler artigoPolars streaming: processe dados maiores que a RAM — sem Spark
Como a streaming engine do Polars processa datasets que não cabem na memória usando scan_parquet + sink_parquet, mantendo o uso de RAM constante e dispensando um cluster.
Ler artigoMetric Views no Unity Catalog: defina o KPI uma vez, use em todo lugar
Como as Metric Views do Databricks Unity Catalog transformam KPIs de negócio em objetos governados e reutilizáveis — com o passo a passo em YAML, a função MEASURE(), o padrão de consulta, e quando (ou não) usar em 2026.
Ler artigoCDC no SSIS: carga incremental sem varrer a tabela inteira
Como usar Change Data Capture com o CDC Control Task para transformar cargas full em cargas incrementais no SSIS — com código, o padrão de estado por LSN e quando (ou não) usar em 2026.
Ler artigouv: o gerenciador Python que todo Data Engineer precisa conhecer
Descubra como o uv, da Astral, substituiu pip, venv e pyenv nos nossos projetos Databricks e Azure — com ganho de 10 a 100× de velocidade.
Ler artigoIngestão incremental: pare de recarregar tudo toda noite
Watermarking, change data capture e os padrões que reduzem custo e janela de processamento em pipelines de ETL.
Ler artigoSlowly Changing Dimensions Tipo 2 sem dor de cabeça
O padrão essencial para rastrear histórico em dimensões — explicado com um exemplo concreto e os erros mais comuns.
Ler artigoArquitetura Medalhão: o padrão que organiza seu Lakehouse
Como as camadas Bronze, Prata e Ouro transformam um data lake caótico em uma plataforma confiável e auditável.
Ler artigo