Conhecimento prático em engenharia de dados
Guias aprofundados sobre modelagem, ETL, Azure, Databricks e arquitetura de dados — escritos a partir de projetos reais.
SSIS 2025 sem senha no pacote: Entra ID, TLS 1.3 e Fabric com o Microsoft SqlClient
Como usar o novo Microsoft SqlClient Data Provider no ADO.NET connection manager do SSIS 2025 para tirar senhas dos pacotes, ativar TLS 1.3 e conectar no Fabric Warehouse com Entra ID.
Ler artigoAuto Partitioning no Copy job do Fabric Data Factory: mova tabelas gigantes em minutos, sem configurar partição
O Copy job do Fabric Data Factory agora particiona tabelas grandes automaticamente — escolhe a coluna, calcula as fronteiras e roda leituras em paralelo com um único toggle. O que muda, como ativar e onde funciona.
Ler artigoSSIS + PostgreSQL via ODBC: as opções de fetch que evitam o Out of memory — e a armadilha do comentário --
Como UseDeclareFetch/Fetch (cursor server-side) evitam o Out of memory ao extrair PostgreSQL no SSIS via ODBC, como revelar o erro genérico com CommLog, o bug do comentário -- que engole o FETCH, e o fallback com cursor em Python.
Ler artigoDelta Lake em Python puro: escreva tabelas Delta sem Spark com o pacote deltalake (delta-rs)
Como o pacote deltalake (delta-rs, núcleo em Rust/Arrow) grava tabelas Delta legítimas sem Spark nem JVM — escrita, MERGE, OPTIMIZE e time travel em Python, e onde o Spark ainda vence.
Ler artigoPrevisão de séries temporais em uma chamada SQL: o ai_forecast() do Databricks
Como o ai_forecast() do Databricks entrega previsão de séries temporais numa única consulta SQL — a sintaxe, a previsão por grupo, o que a função devolve, e quando (não) usar.
Ler artigoCLUSTER BY AUTO no Databricks: pare de escolher chaves de clustering na mão
Como o CLUSTER BY AUTO (Automatic Liquid Clustering) faz o Databricks escolher e manter as chaves de clustering sozinho — o que muda em relação a partição/ZORDER, como ativar, requisitos e quando (não) usar.
Ler artigoNarwhals: escreva código de DataFrame uma vez e rode em pandas, Polars e PyArrow
O que é o Narwhals — a camada leve de compatibilidade que deixa você escrever a lógica de DataFrame uma única vez (API estilo Polars) e rodar em pandas, Polars, PyArrow e mais, sem lock-in e sem dependências obrigatórias.
Ler artigoai_parse_document(): transforme PDF em tabela governada com uma única instrução SQL
Como o ai_parse_document() do Databricks colapsa OCR, parsing e reconstrução de tabelas em uma única instrução SQL — entregando o resultado como tabela governada no Unity Catalog.
Ler artigoExpectations no Lakeflow: qualidade de dados como código, governada no Unity Catalog
Como declarar regras de qualidade ao lado da transformação, escolher entre registrar, descartar ou falhar, e governar tudo pelo Unity Catalog com regras versionadas e auditáveis.
Ler artigoCarga incremental no Azure Data Factory: o padrão de watermark passo a passo
Como fazer carga incremental no Azure Data Factory usando o padrão de watermark: Lookup do último valor, Copy Data só da janela nova e Stored Procedure que atualiza o controle. Guia prático.
Ler artigoData Flow do SSIS até 3× mais rápido: ajustando o buffer e o Fast Load
Como usar AutoAdjustBufferSize, DefaultBufferMaxRows e Fast Load para acelerar cargas grandes no Data Flow do SSIS. Guia prático com números reais.
Ler artigoCheckpoints no SSIS: como retomar um pacote do ponto exato da falha
Como usar os Checkpoints do SSIS para retomar um pacote longo do ponto exato da falha — as 3 propriedades de configuração, as armadilhas com Data Flow e loops, e quando (ou não) usar em 2026.
Ler artigoPolars streaming: processe dados maiores que a RAM — sem Spark
Como a streaming engine do Polars processa datasets que não cabem na memória usando scan_parquet + sink_parquet, mantendo o uso de RAM constante e dispensando um cluster.
Ler artigoMetric Views no Unity Catalog: defina o KPI uma vez, use em todo lugar
Como as Metric Views do Databricks Unity Catalog transformam KPIs de negócio em objetos governados e reutilizáveis — com o passo a passo em YAML, a função MEASURE(), o padrão de consulta, e quando (ou não) usar em 2026.
Ler artigoCDC no SSIS: carga incremental sem varrer a tabela inteira
Como usar Change Data Capture com o CDC Control Task para transformar cargas full em cargas incrementais no SSIS — com código, o padrão de estado por LSN e quando (ou não) usar em 2026.
Ler artigouv: o gerenciador Python que todo Data Engineer precisa conhecer
Descubra como o uv, da Astral, substituiu pip, venv e pyenv nos nossos projetos Databricks e Azure — com ganho de 10 a 100× de velocidade.
Ler artigoIngestão incremental: pare de recarregar tudo toda noite
Watermarking, change data capture e os padrões que reduzem custo e janela de processamento em pipelines de ETL.
Ler artigoSlowly Changing Dimensions Tipo 2 sem dor de cabeça
O padrão essencial para rastrear histórico em dimensões — explicado com um exemplo concreto e os erros mais comuns.
Ler artigoArquitetura Medalhão: o padrão que organiza seu Lakehouse
Como as camadas Bronze, Prata e Ouro transformam um data lake caótico em uma plataforma confiável e auditável.
Ler artigo