DATA ENGINEERING

NYC Taxi Data

Construction d'un data warehouse autour des données NYC Taxi, avec Snowflake et dbt, sur plus de 78 millions de lignes

SnowflakedbtPythonDuckDBSQL
78M+lignes traitées
2 ansde données ingérées
7étapes dans le pipeline

LE PROJET

Transformer des données brutes en données exploitables

Le projet consiste à récupérer les données NYC TLC Yellow Taxi, les valider puis les charger dans Snowflake afin de construire un modèle de données exploitable

Les transformations sont gérées avec dbt afin de séparer clairement les données sources, les transformations et les modèles finaux.

ARCHITECTURE

De la donnée brute au modèle final

Une pipeline complète qui automatise l'ingestion, la validation, le stockage et la transformation des données NYC Taxi

SOURCENYC TLC
INGESTIONPython
STORAGEParquet
VALIDATIONDuckDB
RAWSnowflake
TRANSFORMdbt
ANALYTICSFINAL
NYC TAXI DATA PIPELINE

01 — INGESTION

Récupérer et valider les données

Les données mensuelles NYC TLC sont téléchargées au format Parquet puis chargées dans DuckDB pour effectuer une première validation avant leur envoi vers Snowflake

L'ingestion historique permet notamment de reconstruire plusieurs mois de données et de préparer le chargement de la couche RAW

02 — TRANSFORMATION

Structurer les données avec dbt

Les données brutes sont chargées dans Snowflake avant d'être transformées avec dbt

Le projet sépare les données RAW, les modèles de staging et les modèles finaux afin de garder une pipeline claire et reproductible

03 — AUTOMATISATION

Automatiser l'exécution du pipeline

GitHub Actions orchestre les différentes étapes du projet afin d'automatiser les traitements et l'ingestion des nouvelles données

L'objectif est de passer d'un traitement manuel à une pipeline reproductible pouvant être exécutée régulièrement

TECHNOLOGIES

Python

Téléchargement des données et logique d'ingestion

DuckDB

Validation et traitement local des fichiers Parquet

Snowflake

Stockage de la couche RAW et des données transformées

dbt

Transformation et modélisation SQL

SQL

Nettoyage, transformation et construction des modèles

GitHub Actions

Automatisation des différentes étapes du pipeline

← Retour aux projets
↑