L'IA est-elle aussi bonne en français qu'en anglais

Sur cette page
- L'essentiel
- Qu'est-ce qui est réellement mesuré, et qu'est-ce qui ne l'est pas ?
- Quel est le seul écart établi, et combien coûte-t-il ?
- Où le français décroche-t-il réellement en usage professionnel ?
- Comment mesurer les deux chez vous en une heure ?
- Faut-il travailler en anglais pour obtenir de meilleurs résultats ?
- Par quoi commencer cette semaine ?
- À lire également
- FAQ
Le comparatif multilingue le plus cité de la recherche récente, MMLU-ProX, couvre vingt-neuf langues dont le français, avec 11 829 questions rigoureusement identiques par langue, ce qui autorise des comparaisons directes. Son résumé annonce des écarts allant jusqu'à 24,3 %, mais ces écarts concernent les langues peu dotées, et le papier ne publie aucun chiffre opposant le français à l'anglais. À la vérification du 19 août 2026, aucune source de niveau institutionnel ou académique ne publie cet écart sous une forme citable.
Cette absence n'est pas un trou de recherche parmi d'autres, elle change la question. Puisque personne ne mesure la perte de qualité en français, toute affirmation chiffrée sur le sujet, dans un sens ou dans l'autre, est inventée. Ce qui se mesure et se facture, en revanche, c'est le nombre de jetons qu'un même texte consomme selon la langue dans laquelle il est écrit, et c'est là que le français coûte, sans que le moindre débat sur la qualité soit nécessaire.
Cet article détaille ce qui est réellement mesuré et ce qui ne l'est pas, pourquoi les classements d'hallucination et de factualité ne disent rien du français, le seul écart établi et sa conséquence économique, les endroits où le français décroche réellement dans un usage professionnel, et le protocole en quatre étapes pour mesurer les deux chez vous en une heure.
L'essentiel
Aucun chiffre public ne mesure la perte de qualité d'un grand modèle de langue en français par rapport à l'anglais sur des tâches professionnelles, et les classements les plus cités sur les hallucinations et la factualité sont conduits intégralement en anglais, ce que leurs auteurs déclarent en limite de leurs travaux. Un écart est en revanche parfaitement documenté et il est économique : les équivalences entre jetons et mots publiées par les éditeurs valent pour l'anglais, et le français produit davantage de jetons à texte équivalent, sans qu'aucun éditeur ne publie de coefficient. Les décrochages réellement observés en usage professionnel ne portent pas sur la langue générale mais sur le vocabulaire des dispositifs administratifs français et ouest-africains, que les modèles connaissent mal. Ces deux points se mesurent chez soi en une heure.
Qu'est-ce qui est réellement mesuré, et qu'est-ce qui ne l'est pas ?
Le français est couvert par les évaluations multilingues, et l'écart qui intéresse une entreprise n'en sort pas, ce qui n'est pas la même chose qu'une absence de données.
MMLU-ProX, soumis en mars 2025 et révisé en mai 2025, construit une version de son jeu de questions dans chacune des vingt-neuf langues couvertes, avec des questions identiques, ce qui est méthodologiquement la bonne façon de procéder. Le papier compare trente-six modèles et annonce des écarts pouvant atteindre 24,3 %, mais ces écarts sont rattachés aux langues peu dotées, celles pour lesquelles les données d'entraînement sont rares. Le français n'appartient pas à cette catégorie, et le résumé du papier ne publie pas de valeur le concernant.
| Mesure | Ce qu'elle couvre | Ce qu'elle dit du français |
|---|---|---|
| MMLU-ProX | 29 langues, 11 829 questions identiques par langue, 36 modèles | le français est couvert, aucun écart publié le concernant |
| Classement Vectara des hallucinations | fidélité d'un résumé à un document fourni | le modèle d'évaluation ouvert ne couvre que l'anglais |
| AA-Omniscience | connaissance sans document ni outil, 6 000 questions | toutes les questions sont en anglais, déclaré en limite |
| Suite FACTS | mémoire, recherche, image, ancrage documentaire | aucune couverture multilingue annoncée |
Sources : publications et dépôts d'origine, relevés le 19 août 2026.
La lecture de ce tableau est plus intéressante que chacune de ses lignes. Les trois mesures de fiabilité les plus citées en français, celles dont les chiffres circulent dans tous les articles du secteur, sont conduites intégralement en anglais et leurs auteurs le déclarent. Un dirigeant francophone qui lit qu'un modèle affiche 1,8 % d'hallucination lit donc un résultat obtenu dans une autre langue que celle où il l'emploiera, ce que notre article sur ce que mesurent réellement ces taux détaille par ailleurs.
Il faut donc écrire ce que la recherche n'a pas écrit : la perte de qualité d'un modèle en français par rapport à l'anglais, sur des tâches professionnelles, n'est mesurée par personne. Cette absence est un fait vérifiable, et elle vaut mieux qu'un chiffre inventé. Elle rejoint celle que nous avons documentée pour les langues ouest-africaines dans notre article sur l'IA et le wolof, à une différence près qui compte : le wolof n'est pas couvert par les évaluations, le français l'est, et c'est la comparaison qui n'est pas publiée.
Quel est le seul écart établi, et combien coûte-t-il ?
Le nombre de jetons, et il se facture à chaque requête, indépendamment de toute considération de qualité.
Les modèles ne lisent pas des mots mais des jetons, unités de découpage du texte qui servent aussi d'unité de facturation. La documentation d'Anthropic donne une estimation générale : un jeton vaut environ quatre caractères ou 0,75 mot, et elle précise explicitement que cette estimation vaut pour l'anglais et que le compte exact varie selon la langue et le type de contenu. Aucun éditeur ne publie de coefficient équivalent pour le français.
Ce silence a une conséquence directe et rarement formulée. Les découpages sont entraînés majoritairement sur des corpus anglophones, et une langue moins représentée y est découpée en morceaux plus nombreux. À texte équivalent, un document français consomme donc davantage de jetons que sa traduction anglaise, ce qui se traduit par trois effets cumulés : une facture plus élevée à l'usage programmatique, une fenêtre de contexte qui se remplit plus vite, et une limite d'usage atteinte plus tôt sur un abonnement.
Il faut ajouter une réserve d'honnêteté que la plupart des articles omettent : le sens de l'écart est établi, son ampleur ne l'est pas. Aucune source primaire ne chiffre le surcoût en jetons du français, et nous n'en fabriquons pas. C'est précisément ce que le protocole de la section suivante permet de mesurer sur vos propres documents, en dix minutes, avec un résultat qui vaut pour votre matière et pas pour une moyenne.
Où le français décroche-t-il réellement en usage professionnel ?
Pas sur la langue générale, où les modèles récents sont solides, mais sur le vocabulaire des dispositifs administratifs, qui est propre à chaque pays et faiblement représenté dans les corpus.
L'expérience des déploiements que nous accompagnons converge sur un point qu'aucune évaluation ne capte, parce que les jeux de questions sont conçus pour être traduisibles et donc universels. Un modèle rédige un courrier commercial en français impeccable, et se trompe sur ce qu'est un opérateur de compétences, sur le contenu d'un bilan pédagogique et financier, sur l'articulation entre un contrat de professionnalisation et une convention, ou sur la nature exacte d'une déclaration sociale. Ces objets n'ont pas d'équivalent anglophone, ils ne figurent pas dans les corpus dominants, et un modèle produit à leur sujet des réponses parfaitement bien tournées et fausses.
Le même phénomène s'observe, en plus marqué, sur les référentiels ouest-africains. Les procédures d'une administration sénégalaise ou ivoirienne, les intitulés des dispositifs nationaux et les formalités locales appartiennent à une littérature peu numérisée, et l'écart entre l'assurance du ton et l'exactitude du contenu y atteint son maximum. C'est aussi la raison pour laquelle notre article sur les guides français qui ne fonctionnent pas dans la région insiste sur les hypothèses implicites : elles se retrouvent, intactes, dans les réponses générées.
La conséquence pratique est plus rassurante qu'il n'y paraît, parce qu'elle est circonscrite. Le décrochage ne touche pas la langue mais un domaine de connaissance, et il se traite exactement comme n'importe quel manque de connaissance : en fournissant le document de référence dans la demande plutôt qu'en espérant que le modèle le connaisse. Un texte réglementaire collé dans la conversation supprime le problème, là où aucune reformulation de la question ne l'aurait résolu.
Comment mesurer les deux chez vous en une heure ?
En quatre étapes, dont deux ne demandent qu'un compte ordinaire et un chronomètre. Le protocole mesure deux choses distinctes, le surcoût en jetons et l'écart de qualité, et il ne les confond pas.
Étape 1, le surcoût en jetons. Prenez un document de travail réel d'environ deux mille mots. Faites-en produire une traduction anglaise par l'outil lui-même. Soumettez ensuite les deux versions, séparément, à une même demande simple, et relevez la consommation déclarée par votre compte pour chacune. Le rapport entre les deux consommations est votre coefficient, sur votre matière. Il vaut mieux qu'une moyenne publiée, puisque le vôtre dépend de votre vocabulaire.
Étape 2, la tâche unique. Choisissez une seule tâche que votre équipe répète, et écrivez ce qu'une bonne réponse doit contenir, avant tout test. Cette référence écrite à l'avance est ce qui empêche la notation au ressenti, systématiquement favorable au premier essai.
Étape 3, le test croisé. Faites passer dix cas réels dans deux conditions : la demande en français sur un document français, puis la demande en anglais sur la traduction anglaise du même document. Notez chaque réponse contre la référence de l'étape 2, sans savoir dans quelle condition vous êtes si un collègue peut mélanger les copies.
Étape 4, le test qui compte vraiment. Reprenez cinq cas portant sur vos dispositifs administratifs, et posez-les d'abord sans document, puis en collant le texte de référence dans la demande. L'écart entre ces deux séries sera presque toujours plus grand que l'écart entre le français et l'anglais de l'étape 3, et c'est le résultat le plus actionnable de tout l'exercice.
Ce protocole diffère volontairement de celui que nous proposons pour les langues ouest-africaines, qui répond à une autre question : là, aucune évaluation n'existe et il faut tout construire ; ici, la langue est bien couverte et ce sont le coût et le domaine de connaissance qu'il faut isoler.
Faut-il travailler en anglais pour obtenir de meilleurs résultats ?
Non dans la très grande majorité des cas, et la question mérite d'être tranchée parce qu'elle circule beaucoup dans les équipes.
Trois raisons s'y opposent, et aucune n'est linguistique. La première est que le livrable est destiné à des lecteurs francophones : une chaîne qui passe par l'anglais ajoute deux traductions, donc deux occasions de perdre une nuance, pour un gain de qualité que personne n'a mesuré. La deuxième est que la matière de l'entreprise est en français, et qu'un document traduit avant d'être soumis perd exactement les termes métier sur lesquels la précision comptait. La troisième est que le surcoût en jetons se paie sur le document français comme sur sa traduction, la traduction elle-même ayant un coût.
Un cas particulier échappe à ce raisonnement et mérite d'être connu. Lorsque la demande porte sur un domaine technique dont la littérature est majoritairement anglophone, et que le résultat attendu est une compréhension plutôt qu'un livrable, poser la question en anglais donne souvent accès à une matière plus riche. La bonne pratique consiste alors à poser la question en anglais et à demander la réponse en français, ce que les modèles font sans difficulté.
Par quoi commencer cette semaine ?
Par la mesure du coût, qui prend dix minutes et donne un chiffre que personne d'autre ne peut vous donner.
Faites l'étape 1 du protocole sur un de vos documents. Vous obtiendrez votre propre coefficient de surcoût, sur votre propre vocabulaire, et vous saurez ce que la langue vous coûte réellement. C'est le seul chiffre honnête disponible sur ce sujet, et il est à vous.
Listez ensuite les cinq notions administratives que vos équipes demandent le plus souvent à l'outil. Ce sont vos points de décrochage probables, et ils se traitent par la fourniture du document de référence, pas par une meilleure formulation.
Rangez enfin ces documents de référence à un seul endroit accessible. Un dossier partagé contenant les textes que votre activité mobilise vaut mieux que n'importe quel réglage, parce qu'il transforme une question de connaissance en question de lecture, et que la lecture, elle, fonctionne aussi bien en français qu'en anglais. C'est le premier chantier que nous ouvrons chez nos clients quand un usage documentaire se met en place.
Ce que cet article établit tient en trois lignes. L'écart de qualité entre le français et l'anglais n'est mesuré par personne, et les classements les plus cités sont conduits en anglais, ce que leurs auteurs déclarent. L'écart qui existe et qui se paie est celui du découpage en jetons, dont le sens est établi et l'ampleur inconnue, et que vous pouvez mesurer chez vous en dix minutes. Le décrochage réel ne porte pas sur la langue mais sur les dispositifs administratifs français et ouest-africains, et il se corrige en fournissant le texte plutôt qu'en changeant de langue.
À lire également
- Pourquoi l'IA invente des réponses, et comment l'éviter : ce que mesurent réellement les classements, et pourquoi ils sont tous conduits en anglais.
- L'IA parle-t-elle wolof : le test à faire chez vous : la même absence de mesure sur les langues ouest-africaines, et le protocole en six étapes qui lui correspond.
- Ce que l'IA générative sait faire, et ce qu'elle ne sait pas : les quatre propriétés d'une tâche qui la rendent indélégable, dont celle des données jamais vues.
- Les guides français sur l'IA ne marchent pas chez nous : les hypothèses implicites du corpus français, qui se retrouvent intactes dans les réponses générées.
FAQ
L'IA est-elle moins performante en français qu'en anglais ?
Personne ne le sait avec précision, et c'est la réponse honnête. Le principal comparatif multilingue couvre le français avec des questions identiques par langue mais ne publie aucun écart le concernant, et les écarts de 24,3 % qu'il annonce visent les langues peu dotées. Aucune source citable ne mesure cet écart pour le français sur des tâches professionnelles.
Pourquoi les taux d'hallucination publiés ne valent-ils pas pour le français ?
Parce qu'ils sont mesurés en anglais, et que leurs auteurs le déclarent. Le modèle d'évaluation ouvert du classement Vectara ne couvre que l'anglais, et l'évaluation AA-Omniscience précise en limite que toutes ses questions sont en anglais. Ces chiffres décrivent un comportement dans une langue qui n'est pas votre langue de travail.
Le français coûte-t-il plus cher que l'anglais ?
Oui, et c'est le seul écart établi. Les équivalences entre jetons et mots publiées par les éditeurs valent explicitement pour l'anglais, et une langue moins représentée dans les corpus de découpage produit davantage de jetons à texte équivalent. Le sens de l'écart est certain, son ampleur n'est publiée par aucun éditeur : mesurez-la sur vos propres documents.
Faut-il rédiger ses demandes en anglais ?
Non dans la plupart des cas. Vos livrables et votre matière sont en français, et passer par l'anglais ajoute deux traductions, donc deux occasions de perdre une nuance, pour un gain que personne n'a mesuré. L'exception concerne les sujets techniques dont la littérature est surtout anglophone : posez alors la question en anglais et demandez la réponse en français.
Où l'IA se trompe-t-elle le plus souvent en français ?
Sur le vocabulaire des dispositifs administratifs, français comme ouest-africains, qui n'ont pas d'équivalent anglophone et sont faiblement représentés dans les corpus. Un modèle rédige un français impeccable et se trompe sur ce qu'est un opérateur de compétences ou sur une formalité locale. Le remède n'est pas de changer de langue mais de fournir le texte de référence dans la demande.
Comment mesurer cela chez moi ?
En une heure, avec un document de travail réel. Comparez la consommation déclarée pour la version française et pour sa traduction anglaise afin d'obtenir votre coefficient de coût, puis faites passer dix cas réels dans les deux langues contre une référence écrite à l'avance. Terminez par cinq cas portant sur vos dispositifs administratifs, avec et sans document fourni : c'est cet écart-là qui sera le plus grand.
Pour aller plus loin
E-book : les outils IA qui comptent en 2026
Le panorama des outils qui meritent votre attention, et de ceux qui n'en meritent pas.
Telecharger l'e-bookKaramo Sylla
Fondateur d'AI5D
Karamo Sylla est ingenieur et consultant en intelligence artificielle, fondateur d'AI5D. Il accompagne les dirigeants et les organisations d'Afrique de l'Ouest dans leur transformation par l'IA, de la strategie a l'execution, et il est le createur du Protocole AI5D.