Un pipeline ETL extrait, transforme et charge des données. Le construire pas à pas avec des outils réels donne aux apprenants une vision concrète du data engineering.
Points clés
- Distinguer ETL et ELT clairement
- Outiller l'extraction et la transformation
- Orchestrer et fiabiliser le pipeline
Distinguer ETL et ELT clairement
Posez d'abord la différence : ETL transforme avant de charger, ELT charge brut puis transforme dans l'entrepôt, approche dominante avec les bases modernes. Décrivez les trois phases : extraction depuis des sources (API, CSV, base), transformation (nettoyage, jointures, agrégations), chargement vers une destination. Cette grille de lecture structure tout projet de pipeline. Le choix dépend du volume et de l'outillage.
Outiller l'extraction et la transformation
Pour l'extraction, montrez la lecture de fichiers, l'appel d'API avec requests, et l'extraction de base avec SQL. Pour la transformation, utilisez pandas ou Polars sur des volumes modestes, et introduisez dbt pour les transformations SQL versionnées et testées en entrepôt. DuckDB sert d'environnement d'entrepôt local idéal pour la formation. La transformation est l'étape où se joue la qualité des données.
Orchestrer et fiabiliser le pipeline
Un pipeline doit être planifié, surveillé et reproductible. Introduisez un orchestrateur comme Airflow, Dagster ou Prefect pour enchaîner les tâches, gérer les dépendances et les reprises sur erreur. Ajoutez des contrôles de qualité (volumétrie, valeurs nulles, doublons) à chaque étape. La fiabilité distingue un script jetable d'un vrai pipeline de production.
En pratique
Scénario. Sur une journée (6h), les apprenants construisent un pipeline qui extrait des données météo via une API, les nettoie avec Polars, les charge dans DuckDB, puis applique des transformations avec dbt. Ils orchestrent l'ensemble avec Prefect et ajoutent des tests de qualité. Livrable : un pipeline reproductible documenté et un tableau de contrôle des exécutions.
Questions fréquentes
ETL ou ELT pour débuter ?
Pour comprendre les concepts, l'ETL classique est plus intuitif. En pratique moderne, l'ELT avec dbt et un entrepôt comme DuckDB ou BigQuery est devenu la norme.
Faut-il un orchestrateur dès le premier pipeline ?
Non, un premier pipeline peut être un simple script. L'orchestrateur devient utile dès qu'il y a planification, dépendances entre tâches ou besoin de surveillance.
Pour aller plus loin
Pour approfondir : Aborder l ethique des donnees · Aborder l ia generative d images. Et le reste de nos ressources pour les écoles, OF et formateurs.
Besoin d'un formateur expert ou envie de transmettre ?
tonformateur connecte les écoles et organismes de formation avec des intervenants experts du terrain.
Voir les cours à pourvoir Explorer l'annuaire d'outils →