Évaluation automatique de la dictée
Coder les écrits d’élèves (dictées, recopie et rédaction) avec des modèles d’IA à partir d’une grille de notation
Projet DEPP × SSP Lab (INSEE). Ce site présente les principaux points importants du projet : une présentation générale, l’architecture du pipeline de travail, les résultats, la démarche d’évaluation et le fine-tuning. Pour l’instant, seule l’évaluation des copies de dictées est traitée. A terme, toutes les copies (dictée, recopie et rédaction) pourront être évaluées.
Le problème en une phrase
Depuis 2015, la DEPP (Direction de l’évaluation, de la prospective et de la performance du Ministère de l’Éducation nationale) corrige à la main la dictée d’un échantillon d’élèves de CM2. Cette correction est entièrement manuelle, coûteuse (5 à 10 minutes par copie), et donc difficile à passer à l’échelle.
La question du projet : est-ce que l’IA peut être un nouvel outil permettant d’accélérer l’évaluation des copies et être cfomplémentaire à la correction manuelle faite par les professeurs ?
La tâche
Chaque item (un mot ou un signe de ponctuation) écrit par l’élève reçoit un code. Dans un premier temps, la cible principale du projet est une grille simplifiée à trois modalités :
| Code | Signification |
|---|---|
| 1 | Orthographe correcte |
| 9 | Erreur (lexicale, grammaticale, ou les deux) |
| 0 | Mot absent (oubli de l’élève) |
Pourquoi travailler sur une grille simplifiée ? La grille complète distingue erreur lexicale, grammaticale et mixte (codes 3/4/5). Sur le test pilote, regrouper ces trois codes en un seul (« erreur ») permet de supprimer exactement la zone où les correcteurs humains eux-mêmes divergent le plus.
L’entrée du modèle est l’image scannée de la copie ; la référence est le texte de la dictée (connu à l’avance) et une grille qui donne, pour chaque item, le mot attendu (grille de codage). La sortie est un code par item, accompagné d’un score de confiance.
Deux approches comparées
Le cœur méthodologique du projet est la comparaison de deux méthodes de prédiction des erreurs dans les écrits d’élèves, évaluées par exactement le même code de métriques :
Approche end-to-end
Un seul modèle multimodal lit l’image et produit directement le code de chaque item, en une passe. Simple, rapide, approche par défaut.
Approche en deux étapes
Étape 1 : un modèle transcrit l’image en texte brut (lecture, ou HTR). Étape 2 : un modèle code ce texte. On sépare ainsi lire et juger.
Ces deux approches sont détaillées dans la page Résultats.
Comment lire ce site
Données sensibles. Les copies sont des écritures d’élèves mineurs. Les microdonnées ne quittent jamais le SSP Cloud et ne sont jamais versionnées.