Brains Up AnalyticsBRAINSUPAnalytics
Articles & Guides

Des connaissances concrètes en ingénierie de données

Des guides approfondis sur la modélisation, l'ETL, Azure, Databricks et l'architecture de données — issus de projets réels.

SSIS 2025Microsoft.Data.SqlClient
·4 min de lecture

SSIS 2025 sans mot de passe dans le package : Entra ID, TLS 1.3 et Fabric avec Microsoft SqlClient

Comment utiliser le nouveau Microsoft SqlClient Data Provider dans le connection manager ADO.NET de SSIS 2025 pour sortir les mots de passe des packages, activer TLS 1.3 et se connecter à Fabric Warehouse avec Entra ID.

Lire l'article
Microsoft FabricAzure
·5 min de lecture

Auto Partitioning dans le Copy job de Fabric Data Factory : déplacez des tables géantes en minutes, sans configurer de partition

Le Copy job de Fabric Data Factory partitionne désormais les grandes tables automatiquement — il choisit la colonne, calcule les frontières et lance des lectures en parallèle avec un seul toggle. Ce qui change, comment l'activer et où ça marche.

Lire l'article
SSISPostgreSQL
·6 min de lecture

SSIS + PostgreSQL via ODBC : les options de fetch qui évitent l'Out of memory — et le piège du commentaire --

Comment UseDeclareFetch/Fetch (un curseur server-side) évitent l'Out of memory lors de l'extraction PostgreSQL dans SSIS via ODBC, comment révéler l'erreur générique avec CommLog, le bug du commentaire -- qui avale le FETCH, et le repli avec un curseur en Python.

Lire l'article
Delta LakePython
·6 min de lecture

Delta Lake en Python pur : écrivez des tables Delta sans Spark avec le package deltalake (delta-rs)

Comment le package deltalake (delta-rs, un cœur Rust/Arrow) écrit de vraies tables Delta sans Spark ni JVM — écriture, MERGE, OPTIMIZE et time travel en Python, et où Spark garde l'avantage.

Lire l'article
DatabricksSQL
·5 min de lecture

Prévision de séries temporelles en un seul appel SQL : le ai_forecast() de Databricks

Comment ai_forecast() de Databricks livre une prévision de séries temporelles en une seule requête SQL — la syntaxe, la prévision par groupe, ce que la fonction renvoie, et quand (ne pas) l'utiliser.

Lire l'article
DatabricksUnity Catalog
·4 min de lecture

CLUSTER BY AUTO dans Databricks : arrêtez de choisir les clés de clustering à la main

Comment CLUSTER BY AUTO (Automatic Liquid Clustering) fait choisir et maintenir les clés de clustering par Databricks lui-même — ce qui change face au partitionnement/ZORDER, comment l'activer, les prérequis et quand (ne pas) l'utiliser.

Lire l'article
NarwhalsPython
·4 min de lecture

Narwhals : écrivez votre code DataFrame une fois et exécutez-le sur pandas, Polars et PyArrow

Ce qu'est Narwhals — la couche de compatibilité légère qui vous laisse écrire la logique DataFrame une seule fois (API façon Polars) et l'exécuter sur pandas, Polars, PyArrow et plus, sans lock-in ni dépendances obligatoires.

Lire l'article
DatabricksUnity Catalog
·4 min de lecture

ai_parse_document() : transformez un PDF en table gouvernée avec une seule instruction SQL

Comment ai_parse_document() de Databricks réunit OCR, parsing et reconstruction de tables en une seule instruction SQL — en livrant le résultat comme table gouvernée dans Unity Catalog.

Lire l'article
DatabricksLakeflow
·5 min de lecture

Expectations dans Lakeflow : la qualité des données comme code, gouvernée dans Unity Catalog

Comment déclarer des règles de qualité à côté de la transformation, choisir entre journaliser, écarter ou échouer, et tout gouverner via Unity Catalog avec des règles versionnées et auditables.

Lire l'article
Azure Data FactoryChargement Incrémental
·4 min de lecture

Chargement incrémental dans Azure Data Factory : le pattern de watermark pas à pas

Comment faire un chargement incrémental dans Azure Data Factory avec le pattern de watermark : Lookup de la dernière valeur, Copy Data uniquement de la nouvelle fenêtre et Stored Procedure qui met à jour le contrôle. Guide pratique.

Lire l'article
SSISData Flow
·4 min de lecture

Data Flow SSIS jusqu'à 3× plus rapide : régler le buffer et le Fast Load

Comment utiliser AutoAdjustBufferSize, DefaultBufferMaxRows et Fast Load pour accélérer les gros chargements dans le Data Flow SSIS. Guide pratique avec des chiffres réels.

Lire l'article
SSISCheckpoints
·4 min de lecture

Checkpoints dans SSIS : reprendre un package au point exact de l'échec

Comment utiliser les Checkpoints de SSIS pour reprendre un package long au point exact de l'échec — les 3 propriétés de configuration, les pièges avec Data Flow et les boucles, et quand (ou non) les utiliser en 2026.

Lire l'article
PolarsPython
·5 min de lecture

Polars streaming : traiter des données plus grandes que la RAM — sans Spark

Comment la streaming engine de Polars traite des jeux de données qui ne tiennent pas en mémoire avec scan_parquet + sink_parquet, en gardant une utilisation de RAM constante et sans cluster.

Lire l'article
DatabricksUnity Catalog
·6 min de lecture

Metric Views dans Unity Catalog : définissez le KPI une fois, utilisez-le partout

Comment les Metric Views de Databricks Unity Catalog transforment les KPI métier en objets gouvernés et réutilisables — avec le pas à pas en YAML, la fonction MEASURE(), le pattern de requête, et quand (ou non) les utiliser en 2026.

Lire l'article
SSISCDC
·7 min de lecture

CDC dans SSIS : chargement incrémental sans balayer toute la table

Comment utiliser Change Data Capture avec le CDC Control Task pour transformer des chargements complets en chargements incrémentaux dans SSIS — avec du code, le pattern d'état par LSN et quand (ou non) l'utiliser en 2026.

Lire l'article
PythonData Engineering
·3 min de lecture

uv : le gestionnaire Python que tout Data Engineer devrait connaître

Comment uv, d'Astral, a remplacé pip, venv et pyenv dans nos projets Databricks et Azure — avec un gain de vitesse de 10 à 100×.

Lire l'article
ETLAzure
·1 min de lecture

Ingestão incremental: pare de recarregar tudo toda noite

Watermarking, change data capture e os padrões que reduzem custo e janela de processamento em pipelines de ETL.

Lire l'article
ModelagemData Warehouse
·2 min de lecture

Slowly Changing Dimensions Tipo 2 sem dor de cabeça

O padrão essencial para rastrear histórico em dimensões — explicado com um exemplo concreto e os erros mais comuns.

Lire l'article
DatabricksLakehouse
·2 min de lecture

Architecture médaillon : le pattern qui organise votre Lakehouse

Comment les couches Bronze, Argent et Or transforment un data lake chaotique en une plateforme fiable et auditable.

Lire l'article