Générer vos quiz et vos grilles d'évaluation avec l'IA

Sur cette page
- L'essentiel
- Que dit la recherche sur les quiz générés par IA ?
- Pourquoi le référentiel français aboutit-il au même partage ?
- Comment générer un quiz de positionnement qui tienne ?
- Comment construire une grille d'évaluation finale ?
- Comment repérer un distracteur non fonctionnel ?
- Que change le fait d'exercer en Afrique de l'Ouest ?
- Par quoi commencer cette semaine ?
- À lire également
- FAQ
Une revue systématique publiée le 20 mai 2026 dans le Postgraduate Medical Journal, conduite selon les normes PRISMA 2020 sur 71 études issues de 24 pays, a mesuré la qualité des questions à choix multiple produites par des modèles de langue. Ses résultats sont sans ambiguïté : 86,6 % des items comportent au moins un distracteur non fonctionnel, c'est à dire une mauvaise réponse que presque personne ne choisit, et l'indice de discrimination médian s'établit à 0,28. Les auteurs concluent que ces modèles sont d'utiles outils de rédaction, mais que les preuves disponibles ne soutiennent pas encore leur usage non supervisé en évaluation sommative.
Le référentiel national qualité français aboutit exactement au même partage, par une voie entièrement différente et sans jamais mentionner l'intelligence artificielle. Son indicateur 8, qui porte sur le positionnement à l'entrée d'une prestation, cite explicitement le quiz et le questionnaire à choix multiple parmi les preuves acceptables, et il admet une non-conformité mineure. Son indicateur 11, qui porte sur l'évaluation de l'atteinte des objectifs, ne les cite pas et ne peut donner lieu qu'à une non-conformité majeure. La recherche et le régulateur disent la même chose : générer à l'entrée, jamais à la sortie.
Cet article détaille ce que la recherche établit réellement sur les quiz générés, pourquoi le référentiel français aboutit au même partage, la méthode et le texte exact pour produire un quiz de positionnement solide, la façon de construire une grille d'évaluation finale sans la faire générer, la manière de repérer un distracteur non fonctionnel dans vos propres questionnaires, et par quoi commencer.
L'essentiel
Les modèles produisent des questions bien formées et trop faciles, dont les mauvaises réponses ne remplissent pas leur office : plus de huit items sur dix comportent au moins un distracteur que personne ne choisit, ce qui vide la question de son pouvoir de discrimination sans que rien ne se voie à la lecture. Cette faiblesse est tolérable en positionnement, où l'objectif est d'orienter, et disqualifiante en évaluation finale, où l'objectif est de mesurer. Le référentiel français trace la même frontière et l'assortit d'une sanction asymétrique. La méthode qui en découle est simple : générer les questions de positionnement à partir des prérequis, construire la grille finale à partir des objectifs et à la main, et vérifier la fonctionnalité des distracteurs après la première session plutôt qu'avant.
Que dit la recherche sur les quiz générés par IA ?
Qu'ils sont utilisables comme brouillons et insuffisants comme instruments de mesure, et les chiffres sont précis.
La revue systématique du 20 mai 2026 a interrogé PubMed, Web of Science, Scopus et ERIC jusqu'au 15 février 2026, identifié 1 352 références et retenu 71 études issues de 24 pays, chacune analysée par deux évaluateurs indépendants selon un cadre de validité reconnu. C'est, à notre connaissance, la synthèse la plus large publiée sur le sujet.
86,6 %
des items générés comportent au moins un distracteur non fonctionnel
0,28
indice de discrimination médian des items générés
0,67
difficulté médiane, soit des questions plutôt faciles
Trois résultats méritent d'être lus ensemble, parce qu'aucun n'est parlant seul. La difficulté médiane de 0,67 signifie qu'environ deux tiers des candidats trouvent la bonne réponse : les questions générées sont donc plutôt faciles, ce que d'autres travaux confirment en comparant directement des items produits par un modèle et par des praticiens. L'indice de discrimination médian de 0,28 mesure la capacité d'une question à séparer ceux qui maîtrisent de ceux qui ne maîtrisent pas, et cette valeur est modeste. Enfin, la proportion de distracteurs non fonctionnels explique les deux premiers : une question dont deux mauvaises réponses sur trois sont invraisemblables devient un choix entre deux propositions, donc plus facile et moins discriminante.
Deux autres chiffres de la même revue appellent à la prudence. La fiabilité des tests construits à partir de ces items s'échelonne de 0,51 à 0,81, avec une médiane de 0,68, ce qui reste en deçà des seuils habituellement attendus pour une décision individuelle. Et le taux d'erreur factuelle des items varie, selon les études, de moins de 1 % à 45 %, une dispersion qui interdit toute généralisation et impose une relecture systématique.
La conclusion des auteurs est la phrase à retenir, et elle est mesurée : ces modèles apparaissent comme des outils de rédaction utiles, mais les preuves actuelles ne soutiennent pas encore un usage non supervisé en évaluation sommative. Ils ne disent pas qu'il ne faut pas s'en servir. Ils disent où l'usage tient et où il ne tient pas.
Pourquoi le référentiel français aboutit-il au même partage ?
Parce qu'il distingue lui aussi ce qui sert à orienter de ce qui sert à mesurer, et qu'il assortit les deux d'une sanction très différente.
| Indicateur 8, à l'entrée | Indicateur 11, en sortie | |
|---|---|---|
| Ce que le prestataire doit faire | déterminer les procédures de positionnement et d'évaluation des acquis à l'entrée | évaluer l'atteinte par les publics bénéficiaires des objectifs de la prestation |
| Le quiz est-il nommé dans les preuves ? | oui : quizz, QCM, exercices, mise en situation, test | non : outils d'évaluation à chaud et à froid, auto-évaluation, bilans, comptes rendus, taux de réussite |
| Non-conformité possible | mineure, si le dispositif existe mais est incomplet | majeure uniquement |
Sources : guide de lecture du référentiel national qualité, version en vigueur au 19 août 2026, et décret n° 2026-728 du 1er août 2026.
L'asymétrie de sanction est le fait décisif et il est très peu connu. Le guide de lecture énumère les indicateurs susceptibles de donner lieu à une non-conformité mineure, et l'indicateur 11 n'y figure pas : tout manquement, même partiel, y est majeur. L'indicateur 8, lui, y figure, et une non-conformité mineure y est caractérisée par un dispositif existant mais incomplet. Un formateur qui génère ses questions de positionnement travaille donc sur le terrain le plus tolérant du référentiel, et celui qui génère son évaluation finale sur le plus sévère.
Une seconde raison, plus profonde, explique ce partage. Le référentiel exige à l'indicateur 5 des objectifs opérationnels et évaluables, que son glossaire définit comme observables et mesurables, et l'indicateur 11 demande d'évaluer l'atteinte de ces objectifs. Une grille d'évaluation finale n'est donc pas un questionnaire sur un contenu : c'est l'instrument qui relie une liste d'objectifs annoncés à une mesure, comme le détaille notre article sur la conception d'une formation avec l'IA. Demander à un modèle un quiz à partir d'un support produit inévitablement une évaluation du support, jamais une évaluation des objectifs, et l'écart ne se voit pas à la relecture puisque le document est irréprochable.
Le référentiel change par ailleurs au 1er novembre 2026, le décret du 1er août portant le nombre d'indicateurs de 32 à 33 sans renumérotation des existants. La liste de gradation citée ici est celle du guide en vigueur au 19 août 2026, et elle se revérifie auprès de son organisme certificateur après cette date.
Comment générer un quiz de positionnement qui tienne ?
En partant des prérequis et non du contenu, et en imposant au modèle les contraintes qu'il ne respecte pas spontanément.
Le positionnement répond à une question précise, que le glossaire du référentiel formule bien : situer le bénéficiaire par rapport aux objectifs visés, en vue d'adapter la prestation à son profil. Ce n'est pas un examen, et une question trop facile y est moins grave qu'ailleurs, ce qui explique la tolérance du référentiel. Mais un quiz dont tous les candidats sortent avec le même score n'oriente rien, et c'est exactement ce que produit un modèle laissé libre.
Tu produis un questionnaire de positionnement à l'entrée d'une formation. Ce n'est pas un examen : son but est de situer chaque participant par rapport aux prérequis, pour adapter la prestation. Prérequis de la formation, tels que je les ai publiés : [collez vos prérequis, un par ligne] Public : [description]. Nombre de questions : [10 à 15]. Contraintes impératives sur chaque question : - Elle porte sur un prérequis de ma liste, que tu cites au-dessus de la question. Aucune question ne peut porter sur autre chose. - Quatre propositions, une seule correcte. - CHAQUE MAUVAISE RÉPONSE doit correspondre à une erreur réellement commise par quelqu'un qui n'a pas le prérequis. Sous chaque distracteur, écris entre crochets l'erreur ou la confusion qu'il capture. Si tu ne peux pas nommer cette erreur, supprime le distracteur et dis-le-moi. - Interdiction absolue des propositions « toutes les réponses ci-dessus », « aucune des réponses ci-dessus », et des distracteurs manifestement absurdes. - Varie la difficulté : au moins trois questions doivent pouvoir être ratées par quelqu'un qui a partiellement le prérequis. Termine par deux sections : « prérequis non couverts par une question » et « questions dont je ne suis pas certain de l'exactitude factuelle ».
La troisième contrainte est celle qui fait tout le travail, et elle vient directement du résultat de la revue systématique. Obliger le modèle à nommer, sous chaque mauvaise réponse, l'erreur qu'elle capture rend impossible la production d'un distracteur décoratif : soit il existe une confusion réelle et le distracteur est fonctionnel, soit il n'y en a pas et le distracteur tombe. C'est la seule parade connue à un défaut qui touche plus de huit items générés sur dix.
Comment construire une grille d'évaluation finale ?
À partir de la liste d'objectifs, à la main pour la structure, avec le modèle en relecture, et jamais l'inverse.
La grille finale est le seul livrable de cet article que nous déconseillons de faire générer, et la raison n'est pas idéologique : elle est double. La recherche conclut que les preuves ne soutiennent pas un usage non supervisé en évaluation sommative, et le référentiel place ce livrable sur son indicateur le plus sévèrement sanctionné. Les deux convergent, et le gain de temps ne compense pas le risque.
La construction tient en trois colonnes et se fait dans un tableur, en partant de la liste d'objectifs validée en amont. La première colonne reprend chaque objectif mot pour mot. La deuxième dit ce qu'on observe pour établir qu'il est atteint, formulé par un comportement et non par une impression. La troisième dit à quel moment cette observation a lieu, en cours de prestation ou à distance, ce qui recouvre l'évaluation à chaud et à froid que le référentiel cite dans ses exemples de preuves.
Le modèle intervient ensuite, en contradicteur, sur une grille déjà écrite. Trois questions suffisent à le rendre utile : quels objectifs de ma liste ne sont mesurés par aucune ligne, quelles lignes mesurent autre chose que l'objectif qu'elles prétendent mesurer, et quelles observations sont formulées de façon trop subjective pour être constatées par un tiers. Cet usage-là est sûr, parce que le modèle ne produit rien et que ses réponses se vérifient en quelques secondes.
Comment repérer un distracteur non fonctionnel ?
En regardant qui a choisi quoi après la première session, ce qui est la seule méthode fiable et la seule que personne n'applique.
Un distracteur non fonctionnel est une mauvaise réponse que presque aucun candidat ne retient. Il ne se détecte pas à la lecture, parce qu'il est parfaitement bien rédigé, et c'est précisément pourquoi il survit à toutes les relectures. Il se détecte à l'usage, en comptant les réponses.
Ce contrôle vaut mieux que toutes les précautions prises en amont, pour une raison simple : les erreurs réelles de vos participants sont dans vos notes de session, pas dans les données d'entraînement d'un modèle. C'est aussi ce qui fait qu'un questionnaire s'améliore d'une promotion à l'autre, alors qu'un questionnaire généré reste indéfiniment à son niveau de départ.
Que change le fait d'exercer en Afrique de l'Ouest ?
Le référentiel disparaît, la psychométrie reste, et le contenu des distracteurs change entièrement.
Un formateur exerçant à Dakar, Abidjan ou Bamako pour des clients locaux ne relève pas du référentiel national qualité français, et l'asymétrie de sanction décrite plus haut ne le concerne pas. Le partage entre positionnement et évaluation finale, lui, n'est pas une invention réglementaire : c'est une propriété des instruments de mesure, et les résultats de la revue systématique valent quelle que soit la juridiction.
Un point mérite en revanche une attention particulière et il découle de ce que nous avons établi sur les décrochages de l'IA en français : les erreurs typiques d'un public dépendent de son contexte, et un modèle entraîné sur des corpus dominants produira des distracteurs plausibles pour un public français et inertes pour un public ouest-africain. Le contrôle par comptage décrit à la section précédente est donc plus important encore dans ce contexte, parce qu'il est le seul moyen d'attraper cet écart.
Par quoi commencer cette semaine ?
Par vos questionnaires existants plutôt que par un nouveau, et par un comptage plutôt que par une génération.
Reprenez le questionnaire de votre dernière session et comptez les réponses données à chaque proposition. Vous trouverez presque certainement deux ou trois distracteurs que personne n'a choisis, et vous saurez immédiatement pourquoi vos scores se ressemblent tous.
Remplacez ces distracteurs par des confusions que vous avez réellement entendues. Vos notes de session valent mieux que n'importe quelle génération sur ce point précis, et l'opération prend un quart d'heure.
Vérifiez enfin que chaque ligne de votre grille finale se rattache à un objectif publié. S'il existe une ligne sans objectif ou un objectif sans ligne, c'est le premier point qu'un auditeur relèvera, et c'est l'indicateur où la non-conformité est majeure. C'est le contrôle que nous faisons systématiquement au démarrage des accompagnements de formateurs, et il tombe juste plus souvent qu'on ne l'imagine.
Ce que cet article établit tient en une phrase : générer un questionnaire de positionnement est un bon usage, documenté et peu risqué, tandis que générer une évaluation finale cumule la faiblesse mesurée des items produits et la sanction la plus lourde du référentiel. Entre les deux, la différence n'est pas le format, c'est ce qu'on cherche à faire dire au résultat.
À lire également
- Créer une formation complète avec l'IA : la méthode et les prompts : les objectifs opérationnels dont dépend toute grille d'évaluation, et les cinq sorties à rejeter.
- Ce que vous pouvez automatiser dans votre activité de formateur : la chaîne administrative, et l'asymétrie de sanction du référentiel.
- Pourquoi l'IA invente des réponses, et comment l'éviter : le taux d'erreur factuelle et la consigne de vérifiabilité à copier.
- L'IA est-elle aussi bonne en français qu'en anglais : pourquoi les erreurs typiques d'un public local échappent aux modèles.
FAQ
Peut-on générer un quiz de formation avec l'IA ?
Oui pour le positionnement à l'entrée, avec prudence pour l'évaluation finale. Une revue systématique de 71 études publiée le 20 mai 2026 conclut que ces modèles sont d'utiles outils de rédaction mais que les preuves ne soutiennent pas encore leur usage non supervisé en évaluation sommative. Le référentiel qualité français trace la même frontière.
Qu'est-ce qu'un distracteur non fonctionnel ?
Une mauvaise réponse que presque aucun participant ne choisit. Elle réduit de fait le nombre de choix réels, rend la question plus facile et lui retire son pouvoir de discrimination. La revue systématique de mai 2026 rapporte que 86,6 % des items générés en comportent au moins un. Il ne se repère pas à la lecture, seulement en comptant les réponses après une session.
Les questions générées par IA sont-elles trop faciles ?
Plutôt, oui. La difficulté médiane relevée par la revue systématique est de 0,67, ce qui signifie qu'environ deux tiers des candidats trouvent la bonne réponse, et l'indice de discrimination médian n'est que de 0,28. Une comparaison directe avec des questions écrites par des praticiens a par ailleurs montré des items générés significativement plus faciles.
Une grille d'évaluation générée par IA passe-t-elle un audit Qualiopi ?
C'est le livrable le plus risqué du référentiel. L'indicateur 11 ne figure pas parmi ceux qui admettent une non-conformité mineure : tout manquement, même partiel, y est majeur. Et une grille générée à partir d'un contenu évalue le contenu, pas les objectifs annoncés, ce qui est exactement le défaut recherché en audit. Construisez-la à partir de votre liste d'objectifs et utilisez le modèle en relecture.
Comment améliorer un questionnaire d'une session à l'autre ?
En comptant, après chaque session, combien de participants ont choisi chaque proposition, et en remplaçant les propositions que personne ne retient par des confusions réellement entendues en salle. Vos notes de session contiennent une matière qu'aucun modèle ne possède, et c'est ce qui fait qu'un questionnaire s'améliore alors qu'un questionnaire généré reste à son niveau de départ.
Le référentiel change-t-il au 1er novembre 2026 ?
Oui. Le décret n° 2026-728 du 1er août 2026, publié au Journal officiel du 4 août, porte le référentiel de 32 à 33 indicateurs à compter de cette date, sans renumérotation des existants. Les libellés des indicateurs cités ici sont inchangés, mais la liste des indicateurs admettant une non-conformité mineure doit être revérifiée auprès de votre organisme certificateur après le 1er novembre.
Pour aller plus loin
Programme Coachs et Formateurs
Concevoir et animer avec l'IA, sans perdre ce qui fait votre valeur.
Voir le programmeKaramo Sylla
Fondateur d'AI5D
Karamo Sylla est ingenieur et consultant en intelligence artificielle, fondateur d'AI5D. Il accompagne les dirigeants et les organisations d'Afrique de l'Ouest dans leur transformation par l'IA, de la strategie a l'execution, et il est le createur du Protocole AI5D.