Contexte :
Le laboratoire CREATIS, dans un contexte de projets de recherche national ou européen, est amener à régulièrement gérer de grandes bases d'images médicales (IRM cérébrales, échographies, etc.). Ces données issues d’environnement hospitalier sont transmises sou format DICOM (.dcm, standard international) sous forme de séries d'acquisitions. Ces données sont pseudo-anonymisées en amont par les centres émetteurs et sélectionnées pour une étude définie en suivant un protocole strict.
Afin d'effectuer des analyses, diffusions dans le cadre de collaborations ou encore des apprentissages automatiques, ces données peuvent être reformatées au format NIfTI compressé (.nii.gz) puis correctement labelisées (qualité, contenu, ...) pour enfin être sélectionnées par rapport aux différents besoins des analyses.
Cette étape de "mise en forme - labélisation de la donnée" correspond à la conversion, le respect des conventions de nommage, l’évaluation de l'anonymisation, le contrôle de contenu et de sa pertinence ainsi que l'extraction des données utiles (identification des séries, paramètres d’acquisition de l’image, …).
Cette première étape de nettoyage, d’alignement de la donnée est cruciale pour l'automatisation. Il est cependant aujourd'hui particulièrement chronophage, car souvent sujet à l'erreur et particulièrement critique sur le plan réglementaire (données de santé).
Objectifs du stage :
L'objectif du stage est de concevoir, développer, tester et valider un outil d'automatisation des taches de labélisation piloté par un agent IA.
Il s'agit de développer un workflow s'appuyant sur un modèle de langage local et modeste (≤ 8 milliards de paramètres) et interfaçant un jeu de fonctions Python qui convertiront, anonymiseront (si besoin), contrôleront, identifieront et valideront les images de manière fiable, traçable et reproductible en suivant des instructions en langage naturel.
L'outil s'inscrit dans un environnement de production réel (entrepot Girder et/ou arborescence de fichiers Linux), où il faudra disposer de gardiens afin de garantir la suppression, la corruption ou la diffusion des données d'origines.
Organisation du stage :
Le stage se déroulera sur le site principal du laboratoire sur le campus de la Doua. Le stagiaire sera encadré par Frederic Cervenansky, Ingénieur de recherche, responsable des entrepôts de données au laboratoire, en étroite collaboration avec Thomas Grenier, enseignant-chercheur INSA spécialiste en IA et LLMs et impliqué dans de nombreux projets de recherche clinique multi-centrique.
Ce stage se base sur des technologies Python. Des bonnes connaissances en LLMs et IA sont exigées afin de garantir l’automatisation et l’intégration de cet agent au sein de notre écosystème.
Profil recherché
Nous recherchons un(e) étudiant(e) de Master 2 ou de dernière année d'école d'ingénieur avec de solides bases en LLMs. Un bon niveau en programmation (Python) est attendu. Le ou la stagiaire devra faire preuve de curiosité pour la problématique médicale.
Informations sur le stage
• Stage de 6 mois (début 2027)
• Localisation : Laboratoire CREATIS à l’INSA Lyon
• Encadrement : Frederic Cervenansky (CREATIS), Thomas Grenier (CREATIS)
• Les candidatures sont à effectuer sur ce lien: https://forms.gle/bY2C86cMXP2bF97X9