DATA ENGINEERING
Vélib Data Platform
Une plateforme Data Engineering capable d'ingérer, stocker, transformer et analyser des données Vélib provenant de flux temps réel et de données historiques.
LE PROJET
Une plateforme capable de gérer plusieurs types de flux.
L'objectif était de construire une plateforme complète autour des données Vélib, depuis leur ingestion jusqu'à leur exploitation analytique.
Le projet combine deux approches complémentaires : l'ingestion de données historiques et un flux de données temps réel basé sur Kafka.
ARCHITECTURE
Streaming, batch et traitement distribué.
Les données Vélib transitent par deux chemins d'ingestion avant d'être orchestrées et transformées par Spark.
STREAMING
Des données Vélib qui arrivent en continu.
Récupération des données de stations.
Publication des événements.
Transport du flux Kafka.
Écriture des données brutes dans MinIO.
BATCH PROCESSING
Les données historiques suivent un autre chemin.
ORCHESTRATION
Airflow coordonne les traitements.
L'infrastructure est démarrée par Docker Compose tandis qu'Airflow orchestre les différentes étapes du pipeline Data Engineering.
STACK
Les briques de la plateforme.
Ingestion et transport des flux temps réel.
Nettoyage et traitement distribué des données.
Orchestration des pipelines.
Data Lake compatible S3 avec stockage Parquet.
Stockage des données destinées à l'analytics.
Conteneurisation et gestion de l'infrastructure.