Des connaissances concrètes en ingénierie de données
Des guides approfondis sur la modélisation, l'ETL, Azure, Databricks et l'architecture de données — issus de projets réels.
Chargement incrémental dans Azure Data Factory : le pattern de watermark pas à pas
Comment faire un chargement incrémental dans Azure Data Factory avec le pattern de watermark : Lookup de la dernière valeur, Copy Data uniquement de la nouvelle fenêtre et Stored Procedure qui met à jour le contrôle. Guide pratique.
Lire l'articleData Flow SSIS jusqu'à 3× plus rapide : régler le buffer et le Fast Load
Comment utiliser AutoAdjustBufferSize, DefaultBufferMaxRows et Fast Load pour accélérer les gros chargements dans le Data Flow SSIS. Guide pratique avec des chiffres réels.
Lire l'articleCheckpoints dans SSIS : reprendre un package au point exact de l'échec
Comment utiliser les Checkpoints de SSIS pour reprendre un package long au point exact de l'échec — les 3 propriétés de configuration, les pièges avec Data Flow et les boucles, et quand (ou non) les utiliser en 2026.
Lire l'articlePolars streaming : traiter des données plus grandes que la RAM — sans Spark
Comment la streaming engine de Polars traite des jeux de données qui ne tiennent pas en mémoire avec scan_parquet + sink_parquet, en gardant une utilisation de RAM constante et sans cluster.
Lire l'articleMetric Views dans Unity Catalog : définissez le KPI une fois, utilisez-le partout
Comment les Metric Views de Databricks Unity Catalog transforment les KPI métier en objets gouvernés et réutilisables — avec le pas à pas en YAML, la fonction MEASURE(), le pattern de requête, et quand (ou non) les utiliser en 2026.
Lire l'articleCDC dans SSIS : chargement incrémental sans balayer toute la table
Comment utiliser Change Data Capture avec le CDC Control Task pour transformer des chargements complets en chargements incrémentaux dans SSIS — avec du code, le pattern d'état par LSN et quand (ou non) l'utiliser en 2026.
Lire l'articleuv : le gestionnaire Python que tout Data Engineer devrait connaître
Comment uv, d'Astral, a remplacé pip, venv et pyenv dans nos projets Databricks et Azure — avec un gain de vitesse de 10 à 100×.
Lire l'articleIngestão incremental: pare de recarregar tudo toda noite
Watermarking, change data capture e os padrões que reduzem custo e janela de processamento em pipelines de ETL.
Lire l'articleSlowly Changing Dimensions Tipo 2 sem dor de cabeça
O padrão essencial para rastrear histórico em dimensões — explicado com um exemplo concreto e os erros mais comuns.
Lire l'articleArchitecture médaillon : le pattern qui organise votre Lakehouse
Comment les couches Bronze, Argent et Or transforment un data lake chaotique en une plateforme fiable et auditable.
Lire l'article