edumapper
edumapper
Paris, Île-de-France

Data engineer (stage ou alternance)

Data Analytics / Data EngineeringAdversarial Machine LearningData & Artificial Intelligence

Publié il y a environ 11 heures

Stage
⏱️4-6 mois
💼Hybride
📅Expire dans 11 jours
Visa: commence par la liste des documents.

Description du poste

Mission : Concevoir des agents IA qui complètent automatiquement le catalogue de formations d’Edumapper et garantir la fiabilité et la qualité des données produites.

Edumapper modélise l’offre d’études supérieures française et ses débouchés professionnels. Notre référentiel de formations est le cœur du produit : plus il est complet, structuré et à jour, mieux nous aidons les lycéens à faire les bons choix d’orientation. Le problème, c’est que cette information est aujourd’hui dispersée sur des milliers de sites d’établissements, dans autant de formats différents. C’est exactement le sujet de ce stage.

En collaboration directe avec Romain Boyer, notre Head of Data, les co-fondateurs, notre Directeur Scientifique (Julien Randon-Furling) et des doctorants et docteurs en mathématiques, statistique, IA et Machine Learning, tu travailleras sur l’industrialisation et la complétion du catalogue de formations à l’aide d’agents IA avec un haut niveau d’exigence sur la qualité des données :

  • Conception d’agents de scraping intelligent, capables de parcourir les sites des établissements et d’y identifier l’information pertinente, sans règle écrite à la main pour chaque site.
  • Extraction de données structurées exploitables à partir de ces pages : formations, diplômes, modalités d’admission, frais de scolarité…
  • Mapping à nos référentiels internes : normalisation, déduplication et résolution d’entités, pour rattacher chaque information au bon établissement et à la bonne formation.
  • Tests de qualité : mise en place de contrôles automatisés garantissant que seule de la donnée fiable entre dans le référentiel.
  • Mise en production : orchestration, monitoring et fiabilisation du pipeline dans la durée.

Missions annexes (selon l’avancement et tes appétences) :

  • Identification, intégration et consolidation de nouvelles sources de données externes dans nos référentiels.
  • Application et diffusion des bonnes pratiques de modélisation et de qualité dans notre base de données.
  • Amélioration de nos analytics internes, pour mieux piloter le produit et l’activité.

Notre stack : Python, SQL, Dagster, DuckDB et les briques d’IA générative (LLM, agents, RAG) qui vont avec. Ce n’est pas un stage d’observation : tu porteras ton pipeline du prototype à la production, en revue avec le Head of Data, sur un périmètre directement visible dans le produit.