ML4HOR
ML4HOR
Machine learning pour les résultats de santé avec RPrédiction
Description de la formation
ML4HOR est la formation avancée du parcours MHDSR : une introduction pratique au machine learning pour la recherche sur les résultats de santé avec R. Elle couvre le flux supervisé complet (des modèles classiques au boosting et aux réseaux de neurones), l’apprentissage non supervisé et le clustering pour le phénotypage des patients, le réglage et la sélection honnêtes des modèles, l’évaluation et la validation, et l’interprétabilité.
Les flux agentiques et assistés par IA – piloter un pipeline ML reproductible avec un agent de codage en ligne de commande, et l’extraction et la classification assistées par LLM – sont traités dans la formation complémentaire AIDSR.
La formation met l’accent sur la validation, la prévention des fuites de données, les mesures de performance appropriées, la calibration, l’interprétabilité et la pertinence clinique.
Objectifs d’apprentissage
À l’issue de ML4HOR, les participants seront capables de :
- formuler des problèmes supervisés et non supervisés en recherche sur les résultats de santé ;
- préparer des jeux de données tabulaires de santé et éviter les fuites de données ;
- appliquer le clustering au phénotypage des patients et à la découverte de sous-groupes ;
- ajuster régression pénalisée, ensembles d’arbres, boosting et perceptrons multicouches ;
- régler et sélectionner des modèles par validation croisée imbriquée et comparaison équitable ;
- évaluer discrimination, calibration et utilité clinique, et choisir des seuils ;
- valider des modèles en interne et en externe ;
- interpréter des modèles avec permutation importance, PDP/ICE et SHAP.
Calendrier
| N° | Séance |
|---|---|
| 1 | Fondamentaux du machine learning : supervisé vs non supervisé, biais-variance, train/test, validation croisée, rééchantillonnage |
| 2 | Préparation des données : prétraitement, données manquantes, encodage, standardisation, feature engineering, fuite de données |
| 3 | Apprentissage non supervisé et clustering : distances, k-means, clustering hiérarchique, choix de K, silhouette, stabilité, PCA pour exploration et visualisation |
| 4 | Modèles supervisés : régression pénalisée, arbres de décision, forêts aléatoires, gradient boosting, perceptron multicouche, régularisation, early stopping, comparaison de modèles |
| 5 | Réglage, sélection et validation des modèles : hyperparamètres, recherche par grille/aléatoire, validation croisée imbriquée, sur-apprentissage, AUC, sensibilité/spécificité, PPV/NPV, F1, calibration, Brier, seuils, validation interne/externe |
| 6 | Interprétabilité et utilité clinique : importance des variables, permutation, PDP/ICE, SHAP, interprétation locale/globale, seuils de décision en contexte |
Informations pratiques
- Public
- Chercheurs, doctorants, cliniciens, professionnels de la santé publique, analystes de données
- Prérequis
- R de base et culture statistique, comme couvert dans BIOSTATR
- Format
- Séances en direct, diapositives, notebooks, jeux de données, exercices
- Horaire
- Lun/mer/ven 18h00–20h00 (heure du Maroc) · 2 semaines
- Outils
- R, RStudio, Quarto
- Évaluation
- Mini-projet Quarto reproductible
- Étape suivante
- AIDSR – Science des données agentique et assistée par IA avec R