El Hadji Mboup · Data Engineer

Disponible pour un CDI · Île-de-France

Je transforme la donnée en systèmes fiables.

Data Engineer diplômé de Paris-Saclay et ingénieur informatique, avec une expérience concrète en Data Engineering et en production bancaire. Je conçois, industrialise et rends observables des pipelines de données fiables.

Production bancaireCrédit Agricole Technologies & Services
–30 %d’erreurs de données sur un cas qualité
3 environnementsDev · Homologation · Production
2 diplômesParis-Saclay · EPT

Ce que j’apporte

Une vision de bout en bout, du pipeline à l’exploitation.

Je réunis conception data, industrialisation et observabilité pour livrer des systèmes qui restent fiables une fois en production.

01 · BUILD

Concevoir les flux

Ingestion batch et streaming, transformations distribuées, modélisation et stockage adaptés aux usages métier.

Python · SQL · Spark · Kafka · S3
02 · INDUSTRIALIZE

Passer en production

Orchestration, tests, CI/CD et déploiements multi-environnements pour réduire le risque opérationnel.

Airflow · GitLab CI/CD · Ansible · Docker
03 · TRUST

Fiabiliser la donnée

Contrôles qualité, traçabilité, métriques et observabilité pour détecter vite les dérives et anomalies.

Great Expectations · dbt · ELK · Data Quality

Expérience professionnelle

Des systèmes data confrontés aux exigences du réel.

Performance, sécurité, qualité et déploiement : mes expériences couvrent le cycle complet d’un produit data.

Mars — septembre 2026
Crédit Agricole Technologies & Services

Data Engineer · Stage de fin d’études

  • Migration et optimisation de pipelines PySpark vers Spark 3.5 sur YARN en production, avec sécurisation Kerberos et orchestration Oozie.
  • Industrialisation d’un pipeline de prévision multi-entités : SQL avancé sur Teradata, backtesting, contrôles qualité et mise en production.
  • Automatisation des déploiements Dev, Homologation et Production avec GitLab CI/CD et Ansible.
  • Mise en place d’une chaîne d’observabilité Filebeat → Kafka → Logstash → Elasticsearch → Kibana.
  • Contribution à un assistant LLM : simulation d’API métier, injection de données, prompt engineering et benchmark RAG.
PySparkSpark 3.5TeradataKafkaELKYARNGitLab CI/CDAnsible
Octobre 2023 — mai 2025
Atos

Data Engineer · Alternance

  • Développement de pipelines ETL Spark pour des données télécom massives et contribution à une plateforme d’observabilité.
  • Automatisation du monitoring Data Quality avec dbt et Great Expectations, contribuant à réduire de 30 % les erreurs de données.
  • Contribution à une plateforme Big Data suivant une approche Modern Data Stack pour un cas d’usage BCEAO.
  • Développement d’un chatbot LLM/RAG avec LangChain et PostgreSQL.
PythonSQLSparkAirflowdbtGreat ExpectationsMinIODocker

Projets sélectionnés

Des architectures complètes, documentées et reproductibles.

Ces projets prolongent mes expériences professionnelles par des implémentations concrètes autour du cloud, du streaming et de la qualité.

DATA QUALITY · OBSERVABILITY

Plateforme de supervision de données massives

Architecture Bronze/Silver/Gold pour ingérer, transformer, valider et superviser des données à grande échelle avec alerting et dashboards.

MinIO → Spark → Quality → ELK
STREAMING · IOT

Monitoring temps réel de capteurs agricoles

Flux de capteurs multi-régions, règles d’anomalie et états Normal/Alerte/Critique pour détecter les défaillances opérationnelles.

Kafka → Spark Streaming → Elasticsearch
GENAI · RAG

Assistant enrichi par la donnée métier

Injection de données prioritaires, simulation d’API, ciblage documentaire et comparaison d’approches RAG pour améliorer la pertinence des réponses.

API métier → Retrieval → Reranking → LLM

Stack technique

Construire. Fiabiliser. Industrialiser.

Un socle Data Engineering solide, complété par le cloud, le DevOps et les pratiques GenAI utiles à la production.

Data Engineering & Big Data

Python · SQL / PL-SQL · Spark / PySpark · ETL / ELT · Kafka · Hive / HDFS · YARN · Databricks

Orchestration, qualité & observabilité

Airflow · dbt · Great Expectations · ELK · Data Quality · Data Observability

Cloud & DevOps

AWS S3 / Glue / Athena · Docker · Kubernetes · Terraform · GitLab CI/CD · Ansible · Linux

Bases de données

Teradata · PostgreSQL · Oracle · Snowflake · BigQuery

GenAI & MLOps

RAG · LangChain · prompt engineering · ciblage documentaire · MLflow

Formation & certifications

Double culture ingénieur et données à grande échelle.

2025 — 2026

Master 2 DataScale

Université Paris-Saclay · Big Data, NoSQL, Cloud Computing et gestion de données à grande échelle.

2020 — 2025

Diplôme d’Ingénieur de Conception

École Polytechnique de Thiès · Informatique & Télécommunications.

Certifications & accréditations

AWS Certified Cloud Practitioner · Apache Airflow Certification — Astronomer · Databricks Fundamentals Accreditation · Google Cloud Professional Data Engineer Learning Path

Prochaine étape

Construisons une plateforme data qui tient en production.

Je recherche un CDI Data Engineer en France et souhaite rejoindre une équipe qui traite la donnée comme un produit fiable, utile et durable.