DATA ENGINEERING
NYC Taxi Data
Construction d'un data warehouse autour des données NYC Taxi, avec Snowflake et dbt, sur plus de 78 millions de lignes
LE PROJET
Transformer des données brutes en données exploitables
Le projet consiste à récupérer les données NYC TLC Yellow Taxi, les valider puis les charger dans Snowflake afin de construire un modèle de données exploitable
Les transformations sont gérées avec dbt afin de séparer clairement les données sources, les transformations et les modèles finaux.
ARCHITECTURE
De la donnée brute au modèle final
Une pipeline complète qui automatise l'ingestion, la validation, le stockage et la transformation des données NYC Taxi
01 — INGESTION
Récupérer et valider les données
Les données mensuelles NYC TLC sont téléchargées au format Parquet puis chargées dans DuckDB pour effectuer une première validation avant leur envoi vers Snowflake
L'ingestion historique permet notamment de reconstruire plusieurs mois de données et de préparer le chargement de la couche RAW
02 — TRANSFORMATION
Structurer les données avec dbt
Les données brutes sont chargées dans Snowflake avant d'être transformées avec dbt
Le projet sépare les données RAW, les modèles de staging et les modèles finaux afin de garder une pipeline claire et reproductible
03 — AUTOMATISATION
Automatiser l'exécution du pipeline
GitHub Actions orchestre les différentes étapes du projet afin d'automatiser les traitements et l'ingestion des nouvelles données
L'objectif est de passer d'un traitement manuel à une pipeline reproductible pouvant être exécutée régulièrement
TECHNOLOGIES
Téléchargement des données et logique d'ingestion
Validation et traitement local des fichiers Parquet
Stockage de la couche RAW et des données transformées
Transformation et modélisation SQL
Nettoyage, transformation et construction des modèles
Automatisation des différentes étapes du pipeline