AIDSR
AIDSR
Science des données agentique et assistée par IA avec RAssisté par IA
Description de la formation
AIDSR prolonge le parcours MHDSR vers la science des données agentique et assistée par IA avec R : utiliser un agent de codage en ligne de commande pour piloter une analyse et un pipeline ML reproductibles sous contrôle de version, et utiliser des grands modèles de langage pour l’extraction structurée et la classification de texte en recherche en santé.
La formation est pratique et affirmée sur les garde-fous : contrôle de version, exécutions déterministes et journalisées, évaluation face à un étalon de référence, coût et reproductibilité, confidentialité, et un sens clair des situations où il ne faut pas utiliser un LLM ou un agent.
Objectifs d’apprentissage
À l’issue de AIDSR, les participants seront capables de :
- installer et piloter un agent de codage en ligne de commande sur un projet d’analyse sous contrôle de version ;
- utiliser un agent pour générer, exécuter et revoir du code d’analyse de manière reproductible ;
- construire un pipeline ML/d’analyse reproductible de bout en bout avec l’assistance d’un agent ;
- concevoir des schémas et des prompts pour l’extraction structurée à partir de textes et documents cliniques ;
- construire et évaluer des flux de classification et d’annotation de texte fondés sur les LLM ;
- évaluer les sorties des LLM face à un étalon de référence, et quantifier accord, coût et erreur ;
- appliquer des garde-fous de déterminisme, journalisation, confidentialité et reproductibilité ;
- juger quand un LLM ou un agent est, ou n’est pas, approprié pour une tâche.
Calendrier
| N° | Séance |
|---|---|
| 1 | Flux agentiques et agents de codage CLI : ce qu’est un agent de codage, installation, structure de projet, contrôle de version, permissions et garde-fous, itération sûre |
| 2 | Génération, exécution et revue de code avec un agent : itérer sur le code d’analyse, tests, environnements reproductibles, revue et correction des sorties de l’agent |
| 3 | Un pipeline reproductible de bout en bout : des données brutes au rapport avec l’assistance d’un agent, sous contrôle de version, avec journalisation et ré-exécutions |
| 4 | LLM pour l’extraction structurée : conception de schémas, prompting, exemples few-shot, validation, évaluation face à un étalon de référence |
| 5 | LLM pour la classification et l’annotation de texte : classification zero/few-shot, conception de prompts, accord inter-annotateurs, biais et modes de défaillance |
| 6 | Garde-fous, évaluation et reproductibilité : déterminisme, journalisation, coût, confidentialité, analyse d’erreurs, quand ne pas utiliser un LLM, mini-projet final |
Informations pratiques
- Public
- Chercheurs, doctorants, cliniciens, professionnels de la santé publique, analystes de données
- Prérequis
- ML4HOR (ou expérience équivalente en ML) et niveau de R de BIOSTATR
- Format
- Séances en direct, diapositives, notebooks, jeux de données, exercices
- Horaire
- Lun/mer/ven 18h00–20h00 (heure du Maroc) · 2 semaines
- Outils
- R, RStudio, Quarto, un agent de codage en ligne de commande, une API de LLM
- Évaluation
- Mini-projet Quarto reproductible