Data Engineer & Agentic AI · Île-de-France

Je construis des systèmes fiables où les agents IA rencontrent la donnée d'entreprise.

Data engineer spécialisé dans l'industrialisation de pipelines et la modélisation d'entrepôts cloud sur GCP. Aujourd'hui, je déploie des agents autonomes et des serveurs MCP qui connectent Claude à des workflows, bases SQL et outils internes, de l'ingestion jusqu'à la production.

01

Ma façon de travailler

Mon principe : un système qui n'est pas en production n'existe pas. Je privilégie les solutions simples, testées et documentées (CI/CD systématique, qualité de la donnée vérifiée, coûts maîtrisés) plutôt que la sophistication pour elle-même.

Et parce qu'un outil n'a de valeur que s'il est adopté, j'accompagne les équipes métiers au quotidien : documentation claire, formation, itérations à partir de leurs retours. La preuve la plus concrète de cette approche : l'agent IA de ce portfolio, en production dans le widget en bas à droite.

02

Études de cas

C.01

Agent de diagnostic autonome sur un pipeline critique

Agence 79 · MCP
ContexteUn client stratégique dépend d'un workflow GCP orchestrant une dizaine de Cloud Functions (gen2) : consolidation des données, génération des visuels publicitaires et production des fichiers de feed pour plusieurs plateformes. 4 exécutions par jour, chaque run manqué retarde des campagnes en production.
ProblèmeDes incidents récurrents, diagnostiqués à la main : l'erreur remontée par le workflow n'est presque jamais la cause racine, et retrouver l'origine réelle dans les logs d'une dizaine de fonctions prenait jusqu'à une demi-journée par incident. Point critique mesuré : à la mise en production d'une évolution majeure du pipeline, 17 exécutions en échec consécutives, soit 5 jours sans aucune livraison.
Démarche
  1. Outiller. Après la crise, construction d'un serveur MCP (6 outils) connectant Claude aux exécutions du workflow, aux logs et au code source des Cloud Functions. Les logs sont filtrés sur la fenêtre d'exécution en échec et par sévérité pour tenir dans le contexte, et chaque diagnostic doit citer les entrées de log qui le justifient.
  2. Stabiliser. Un mois de diagnostics outillés : 7 causes racines distinctes identifiées et corrigées, chacune confirmée par le correctif appliqué derrière. Le diagnostic passe d'une demi-journée à quelques minutes.
  3. Industrialiser. L'outil éprouvé, l'humain sort de la boucle de diagnostic : agent autonome déclenché par Pub/Sub uniquement en cas d'échec, aucun polling. Il remonte à la cause racine, propose un correctif et alerte l'équipe en moins de 5 minutes. Le correctif reste à la main de l'équipe, et l'agent tourne toujours en production.
Flux automatisé
Résultats
Depuis la stabilisation, sur 2 mois et demi de production :
99%
de succès sur 303 exécutions
0
échec consécutif : chaque incident résolu avant le run suivant
< 5 min
par diagnostic, contre une demi-journée à la main
< 1 €
par mois : le coût suit la panne, pas le temps
PortéeLe dispositif a tourné sur un seul projet client pendant toute la période mesurée. L'agence a décidé de le généraliser à l'ensemble de ses projets.
Détails anonymisés : le code et les données appartiennent à l'agence.
03

Expérience

Data Engineer & Agentic AI · Agence 79

Janv. 2026 → Aujourd'hui
détails
  • Pipelines de données et workflows automatisés sur GCP, dédiés à l'automatisation des campagnes publicitaires clients.
  • Optimisation de l'architecture BigQuery via dbt : modularisation, tests de qualité, gains de performance et réduction des coûts sur de gros volumes.
  • Conception et déploiement d'agents IA autonomes en Python pour lancer et vérifier les campagnes, réduisant drastiquement le risque d'erreur humaine.
  • Écosystème de serveurs MCP connectant Claude à des workflows, bases SQL et outils internes, automatisant les diagnostics complexes et l'exécution d'actions.
  • Déploiement continu (GitLab CI/CD), documentation technique et accompagnement des équipes métiers à l'adoption des outils d'IA.

Data Engineer · Orange Business

Sept. 2022 → Déc. 2025
détails
  • Pipelines de bout en bout pour prédire les délais de déploiement Fibre, intégrant des sources variées (API, bases SQL).
  • Architectures Data Warehouse et modélisation de schémas analytiques garantissant qualité et fiabilité de la donnée.
  • Orchestration automatisée des flux (Dataiku, SQL, Python) et bonnes pratiques CI/CD (Docker, Git) pour la supervision et la reproductibilité en production.
  • Dashboards Power BI stratégiques et collaboration étroite avec les directions métiers pour transformer la donnée en insights actionnables.

Développeur automatisation · Orange Business · Stage

Mars 2022 → Sept. 2022
détails
  • Scripts Python / SQL et flux Dataiku pour la préparation, le nettoyage et la fiabilisation des jeux de données opérationnels.
  • Première approche de la modélisation de données et de l'intégration de briques algorithmiques dans les workflows métier.
04

Projets open source

P.02

RAG_Ollama

Agentic AI
ObjectifChatbot RAG fonctionnant 100% en local : aucune API externe, aucune donnée qui quitte la machine : une réponse aux contraintes RGPD et de confidentialité des entreprises.
ApprocheIndexation vectorielle des documents avec FAISS, récupération des passages pertinents par similarité, génération contrainte au contexte via llama3.2 (Ollama), interface de chat Streamlit.
StackPython FAISS Ollama Streamlit
D'autres projets (dbt, streaming, data engineering) sur GitHub ↗
05

Stack

En production · Agence 79

PythonSQLPandasGCPBigQuerydbtCloud WorkflowsDockerGitGitLabServeurs MCPClaude (Anthropic)Google ADKAgent Platform (Vertex AI)

Aussi dans ma boîte à outils

PySparkSparkKafkaHadoop / HDFSScalaDataikuAirflowAzureSnowflakePostgreSQLMongoDBElasticsearchNLPPyTorchTensorFlowPower BITableauGitHubAnsible
06

Contact

Envie d'échanger sur la data, les agents IA ou l'un de mes projets ? Le mail ou LinkedIn sont les meilleures portes d'entrée.

Langues : Français (natif) · Anglais (professionnel)