INGÉNIEUR DATA SCIENCE PROJET TRANSPOP » INGÉNIEUR HOSPITALIER - H/F
Description du poste
CONTEXTE DU POSTE
Le CHU Grenoble Alpes (CHUGA) est un établissement public de santé situé à Grenoble au cœur des Alpes. Premier Trauma Center de France, il regroupe de nombreuses spécialités médicales, une activité recherche reconnue, ainsi qu'un entrepôt de données de santé (EDS) PREDIMED, destiné à réutiliser des données récoltées dans le cadre de la prise en charge des patients, notamment, à des fins de recherche.
LA CELLULE D'INGÉNIERIE DES DONNÉES DE SANTÉ DU CHUGA (CIDS), regroupant L'ENTREPÔT DE DONNÉES DE SANTÉ1 (EDS) et les data scientists du CENTRE D'INVESTIGATION CLINIQUE - INNOVATION TECHNOLOGIQUE² (CIC-IT) est une structure de recherche du CHUGA. Sa mission est centrée sur l'extraction et l'analyse de données de santé pour l'évaluation des technologies de santé innovantes.
Le CHUGA a été lauréat d'un appel à projet visant à l'organisation d'une compétition en sciences des données3 (data challenge). Cette compétition sera ouverte via une plateforme à des compétiteurs extérieurs au CHUGA. La problématique clinique proposée aux participants portera sur la prédiction du besoin de transfusion per-opératoire à partir des données de santé disponibles en consultation d'anesthésie. Pour cela une base de données rétrospective multicentrique entre le CHUGA et les Hospices Civils de Lyon (HCL), partenaire du projet, devra être constituée à partir des entrepôts de données de santé des centres. Elle devra ensuite être anonymisée par des techniques de génération de données synthétiques afin de pouvoir être mise en libre accès, conformément au RGPD.
Placé sous la responsabilité du responsable de la CIDS et en lien avec les porteurs du projet, l'Ingénieur.e Data Science recruté(e) aura pour mission de collecter et anonymiser les données nécessaires au projet et mettre en place la plateforme de compétition sur un méso-centre de calcul. Ce travail sera réalisé avec l'appui des experts anesthésistes-réanimateurs des centres participants et des partenaires du projet apportant leurs expertises complémentaires en données massives et analyse (laboratoire TIMC4), confidentialité des données (INRIA, équipe Privatics5) et mise en place de plateformes de data challenge (GRICAD6).
MISSIONS PRINCIPALES
ÉLABORATION DES ALGORITHMES D'INTELLIGENCE ARTIFICIELLE
-
Concevoir, mettre en œuvre et qualifier les algorithmes de génération de données synthétiques afin d'anonymiser les données structurées et non-structurées (traitement automatique du langage) ;
-
Concevoir et mettre en œuvre le protocole d'évaluation de la performance des modèles et de l'anonymisation des données mobilisant les métriques adéquates ;
-
Documenter des modèles (GIT) ;
-
Capitaliser et documenter des résultats et des méthodes d'évaluation de la qualité des modèles.
INDUSTRIALISATION DES MODÈLES D'INTELLIGENCE ARTIFICIELLE DANS LES APPLICATIONS
- Industrialiser les modèles de génération de données pour de futurs usages (autres data challenges, offre de services de l'EDS) ;
- Prendre part aux vérifications lors des mises en production ;
- Définir les règles de gestion pour la maintenance des modèles.
VEILLE TECHNOLOGIQUE SUR LES OUTILS DE DATA SCIENCE
- Effectuer une veille sur les nouvelles technologies et solutions logicielles de data science ;
- Rechercher et expérimenter de nouvelles méthodes de modélisation et de data science.
EXTRACTION ET STRUCTURATION DES DONNÉES
-
Concevoir et modéliser le jeu de données, avec les variables pertinentes à introduire dans les modèles ;
-
Collaborer étroitement avec les ingénieurs Data de l'EDS pour qualifier et maitriser la qualité des données tout au long de leur traitement ;
-
Collaborer étroitement avec les experts de l'information médicale et les experts des disciplines médicales pour valider la sélection et les filtres des variables du jeu de données ;
DIVERS
-
Concevoir, rédiger une documentation technique ;
-
Être force de propositions à des problématiques (techniques, ., autres).
Profil recherché
PROFIL REQUIS POUR CE POSTE
Titulaire d'un Diplôme Bac+5 et/ou d'une thèse en Informatique, Mathématiques appliquées ou toute discipline en lien avec la science des données avec un fort attrait pour le secteur de la santé et de la recherche.
Expérience requise en traitement automatique du langage (TAL, NLP), en génération de données synthétiques et autres techniques d'anonymisation des données.
Compétences techniques :
-
Langages de programmation (Python)
-
Architectures de réseaux neuronaux et environnements / librairies de développements associés (PyTorch)
-
Connaissances sur les algorithmes d'IA générative
-
Bases de données et gestion de bases de données
-
Être à l'aise sur les systèmes d'exploitation Unix et Windows
-
Outils collaboratifs GitLab
Savoir-être :
-
Autonomie, dynamisme, aptitude à travailler en équipe
-
...
Données marché — Data scientist
Cadres administratifs, comptables et financiers (hors juristes)
Médian : 3 200 €
postes prévus (BMO 2025)