Dans le cadre de la création d'un poste, nous recrutons un(e) Data Scientist pour rejoindre le Département d'Épidémiologie, de Biostatistique et des Données de Santé et contribuer au projet BRIDGE.
Vos missions
Vous participerez à la conception et au déploiement d'une pipeline d'extraction, de structuration et d'harmonisation des données de santé, en particulier pour les patients atteints de cancer du sein, avec une extension prévue à d'autres pathologies.
Vos principales missions seront de :
concevoir une approche de structuration des données reposant sur des LLM locaux et des approches hybrides d'intelligence artificielle ;
développer des pipelines permettant de traiter des données issues de sources multiples ;
penser les outils développés pour qu'ils soient partageables et adaptables localement ;
évaluer les performances des solutions mises en place et améliorer les processus en mode agile ;
rédiger la documentation associée : guides de procédure, documents utilisateurs, référentiels ;
collaborer étroitement avec les équipes du CAL et de l'IPC impliquées dans le projet ;
contribuer à la structuration et à l'exposition des données selon les normes FHIR, OMOP et OSIRIS RWD.
Votre environnement de travail
Vous travaillerez majoritairement sur des données de santé de vie réelle, en grande partie textuelles, issues de multiples sources : dossier patient informatisé, pharmacie, imagerie, anatomopathologie, oncopharmacologie, chirurgie, oncologie, registres, cohortes ou entrepôts de données de santé.
Le poste s'inscrit dans une dynamique collaborative avec l'Institut Paoli-Calmettes de Marseille, avec des échanges réguliers entre les équipes et le ou la data scientist recruté(e) sur le même projet.
Pourquoi nous rejoindre ?
Un projet innovant à fort impact dans le domaine de la santé.
Un environnement stimulant, au croisement de la donnée, de l'IA et de la recherche.
Une collaboration inter-établissements porteuse de sens.
Un poste évolutif, avec une perspective de pérennisation si le projet atteint ses objectifs.
Quel est le profil idéal ?
Diplôme d'ingénieur, de Data Scientist, d'informatique ou équivalent Bac +5 minimum.
Maîtrise de la structuration de texte par LLM.
Très bonne maîtrise de SQL, Python, Pandas, Numpy ; PL/SQL serait un plus.
Connaissance des données médicales et capacité à travailler sur des sources hétérogènes.
Notions en FHIR, OMOP et OSIRIS RWD appréciées.
Bon niveau de français indispensable.
Voir l'offre et postuler — entrez votre email. Gratuit pour les diplômé(e)s et étudiant(e)s du Groupe ECL, première offre débloquée pour tout le monde.
Entreprise ? Confiez-nous un mandat →