Des connaissances concrètes en ingénierie de données
Des guides approfondis sur la modélisation, l'ETL, Azure, Databricks et l'architecture de données — issus de projets réels.
SSIS 2025 sans mot de passe dans le package : Entra ID, TLS 1.3 et Fabric avec Microsoft SqlClient
Comment utiliser le nouveau Microsoft SqlClient Data Provider dans le connection manager ADO.NET de SSIS 2025 pour sortir les mots de passe des packages, activer TLS 1.3 et se connecter à Fabric Warehouse avec Entra ID.
Lire l'articleAuto Partitioning dans le Copy job de Fabric Data Factory : déplacez des tables géantes en minutes, sans configurer de partition
Le Copy job de Fabric Data Factory partitionne désormais les grandes tables automatiquement — il choisit la colonne, calcule les frontières et lance des lectures en parallèle avec un seul toggle. Ce qui change, comment l'activer et où ça marche.
Lire l'articleSSIS + PostgreSQL via ODBC : les options de fetch qui évitent l'Out of memory — et le piège du commentaire --
Comment UseDeclareFetch/Fetch (un curseur server-side) évitent l'Out of memory lors de l'extraction PostgreSQL dans SSIS via ODBC, comment révéler l'erreur générique avec CommLog, le bug du commentaire -- qui avale le FETCH, et le repli avec un curseur en Python.
Lire l'articleDelta Lake en Python pur : écrivez des tables Delta sans Spark avec le package deltalake (delta-rs)
Comment le package deltalake (delta-rs, un cœur Rust/Arrow) écrit de vraies tables Delta sans Spark ni JVM — écriture, MERGE, OPTIMIZE et time travel en Python, et où Spark garde l'avantage.
Lire l'articlePrévision de séries temporelles en un seul appel SQL : le ai_forecast() de Databricks
Comment ai_forecast() de Databricks livre une prévision de séries temporelles en une seule requête SQL — la syntaxe, la prévision par groupe, ce que la fonction renvoie, et quand (ne pas) l'utiliser.
Lire l'articleCLUSTER BY AUTO dans Databricks : arrêtez de choisir les clés de clustering à la main
Comment CLUSTER BY AUTO (Automatic Liquid Clustering) fait choisir et maintenir les clés de clustering par Databricks lui-même — ce qui change face au partitionnement/ZORDER, comment l'activer, les prérequis et quand (ne pas) l'utiliser.
Lire l'articleNarwhals : écrivez votre code DataFrame une fois et exécutez-le sur pandas, Polars et PyArrow
Ce qu'est Narwhals — la couche de compatibilité légère qui vous laisse écrire la logique DataFrame une seule fois (API façon Polars) et l'exécuter sur pandas, Polars, PyArrow et plus, sans lock-in ni dépendances obligatoires.
Lire l'articleai_parse_document() : transformez un PDF en table gouvernée avec une seule instruction SQL
Comment ai_parse_document() de Databricks réunit OCR, parsing et reconstruction de tables en une seule instruction SQL — en livrant le résultat comme table gouvernée dans Unity Catalog.
Lire l'articleExpectations dans Lakeflow : la qualité des données comme code, gouvernée dans Unity Catalog
Comment déclarer des règles de qualité à côté de la transformation, choisir entre journaliser, écarter ou échouer, et tout gouverner via Unity Catalog avec des règles versionnées et auditables.
Lire l'articleChargement incrémental dans Azure Data Factory : le pattern de watermark pas à pas
Comment faire un chargement incrémental dans Azure Data Factory avec le pattern de watermark : Lookup de la dernière valeur, Copy Data uniquement de la nouvelle fenêtre et Stored Procedure qui met à jour le contrôle. Guide pratique.
Lire l'articleData Flow SSIS jusqu'à 3× plus rapide : régler le buffer et le Fast Load
Comment utiliser AutoAdjustBufferSize, DefaultBufferMaxRows et Fast Load pour accélérer les gros chargements dans le Data Flow SSIS. Guide pratique avec des chiffres réels.
Lire l'articleCheckpoints dans SSIS : reprendre un package au point exact de l'échec
Comment utiliser les Checkpoints de SSIS pour reprendre un package long au point exact de l'échec — les 3 propriétés de configuration, les pièges avec Data Flow et les boucles, et quand (ou non) les utiliser en 2026.
Lire l'articlePolars streaming : traiter des données plus grandes que la RAM — sans Spark
Comment la streaming engine de Polars traite des jeux de données qui ne tiennent pas en mémoire avec scan_parquet + sink_parquet, en gardant une utilisation de RAM constante et sans cluster.
Lire l'articleMetric Views dans Unity Catalog : définissez le KPI une fois, utilisez-le partout
Comment les Metric Views de Databricks Unity Catalog transforment les KPI métier en objets gouvernés et réutilisables — avec le pas à pas en YAML, la fonction MEASURE(), le pattern de requête, et quand (ou non) les utiliser en 2026.
Lire l'articleCDC dans SSIS : chargement incrémental sans balayer toute la table
Comment utiliser Change Data Capture avec le CDC Control Task pour transformer des chargements complets en chargements incrémentaux dans SSIS — avec du code, le pattern d'état par LSN et quand (ou non) l'utiliser en 2026.
Lire l'articleuv : le gestionnaire Python que tout Data Engineer devrait connaître
Comment uv, d'Astral, a remplacé pip, venv et pyenv dans nos projets Databricks et Azure — avec un gain de vitesse de 10 à 100×.
Lire l'articleIngestão incremental: pare de recarregar tudo toda noite
Watermarking, change data capture e os padrões que reduzem custo e janela de processamento em pipelines de ETL.
Lire l'articleSlowly Changing Dimensions Tipo 2 sem dor de cabeça
O padrão essencial para rastrear histórico em dimensões — explicado com um exemplo concreto e os erros mais comuns.
Lire l'articleArchitecture médaillon : le pattern qui organise votre Lakehouse
Comment les couches Bronze, Argent et Or transforment un data lake chaotique en une plateforme fiable et auditable.
Lire l'article