AI5D

Ce que l'IA générative sait faire, et ce qu'elle ne sait pas

Karamo Sylla10 min de lecture
Couverture de l’article : fond encre, le titre « Ce que l’IA générative sait faire, et ce qu’elle ne sait pas » en blanc et bleu, à droite, un arbre de décision à quatre branches dont les deux dernières sont barrées d’une croix bleue.
Sur cette page
  1. L'essentiel
  2. Que produit réellement l'IA générative, quand on regarde les usages plutôt que les promesses ?
  3. Pourquoi le gain ressenti n'est-il pas le gain mesuré ?
  4. Qu'est-ce que l'IA générative ne sait structurellement pas faire ?
  5. Comment décider, tâche par tâche, si l'IA est la bonne réponse ?
  6. Que change le fait de travailler depuis l'Afrique de l'Ouest ?
  7. Par quoi commencer cette semaine ?
  8. À lire également
  9. FAQ

Selon le Baromètre du numérique édition 2026, publié en février 2026 par le CREDOC pour l'Arcep, l'Arcom, le CGE et l'ANCT, 48 % des Français déclarent recourir à l'IA générative, et la proportion monte à 77 % chez les indépendants et à 76 % chez les cadres. Le seul essai contrôlé randomisé publié sur l'effet de ces outils au travail, mené par le laboratoire américain METR et publié le 10 juillet 2025, a mesuré l'inverse de ce que ses participants ressentaient : leurs tâches prenaient 19 % de temps en plus avec l'IA, alors qu'ils estimaient en sortie avoir gagné 20 %.

L'écart entre ces deux nombres est le fait le plus solide dont dispose aujourd'hui un dirigeant qui arbitre, et il déplace la question. Savoir ce que l'IA générative sait faire ne décide rien, parce que la réponse change tous les trimestres et qu'elle est la même pour l'entreprise et pour son concurrent. Ce qui décide, c'est de savoir sur quelles tâches le gain se mesure, puisque le gain ressenti et le gain mesuré sont deux quantités distinctes que rien n'oblige à coïncider.

Ce guide détaille ce que ces outils produisent réellement quand on regarde les usages plutôt que les promesses, pourquoi le gain ressenti s'écarte du gain mesuré, les quatre familles de tâches qu'ils ne savent structurellement pas traiter, l'arbre de décision qui permet de trancher tâche par tâche, ce que le contexte ouest-africain ajoute à cet arbitrage, et par quoi commencer cette semaine.

L'essentiel

L'IA générative produit massivement trois choses : des explications, des documents et des recommandations, et c'est mesuré sur les usages réels plutôt que déclaré par un éditeur. Ce qu'elle ne sait pas faire tient en quatre propriétés de la tâche et non en une liste de sujets interdits : elle ne connaît pas les données propres à l'entreprise, elle ne garantit pas deux fois le même résultat, elle n'endosse aucune responsabilité juridique, et elle produit des erreurs dont la forme reste plausible. Cette dernière propriété est la plus coûteuse, parce qu'elle rend la relecture inopérante là où on la croit suffisante. La conséquence pratique est qu'un déploiement se décide tâche par tâche, sur un critère de mesurabilité du gain, et jamais outil par outil.

Que produit réellement l'IA générative, quand on regarde les usages plutôt que les promesses ?

Des explications, des documents et des recommandations, dans cet ordre, et très loin devant le code auquel ces outils restent associés dans l'imaginaire.

La mesure la plus récente et la plus large est publiée par Anthropic dans son rapport Economic Index intitulé Cadences, paru le 26 juin 2026 sur des données collectées entre le 10 avril et le 10 juin 2026. L'éditeur y classe la sortie principale de chaque conversation, ce qu'il appelle l'artefact, en une trentaine de catégories, et constate que 93 % des conversations en produisent un. Les trois plus fréquentes sont les explications avec 17 % des conversations, les documents et rapports avec 15 %, et les recommandations avec 11 %. Les sorties conversationnelles représentent environ un tiers du total, les livrables écrits environ un tiers également, et le code et le travail technique environ un sixième.

La ventilation par finalité est plus instructive encore pour une direction, parce qu'elle sépare ce que les gens font au travail de ce qu'ils font chez eux. Dans les conversations identifiées comme professionnelles, la sortie dominante est le document ou le rapport avec 20 %, suivi des explications avec 9 %, des brouillons de courriels avec 7 % et des analyses et synthèses avec 6 %. Dans les conversations personnelles, 6 % seulement produisent un document, l'essentiel se répartissant entre explications avec 25 % et recommandations avec 22 %.

Sortie produiteConversations de travailConversations personnelles
Documents et rapports20 %6 %
Explications9 %25 %
Recommandationshors trio de tête22 %
Brouillons de courriels7 %hors trio de tête
Analyses et synthèses6 %hors trio de tête

Source : Anthropic, Economic Index report: Cadences, 26 juin 2026, données du 10 avril au 10 juin 2026.

Deux réserves accompagnent ces chiffres et doivent être portées avec eux. La première est qu'ils décrivent les utilisateurs d'un seul éditeur, dont la clientèle est plus technique que la moyenne du marché : le rapport précédent, Learning curves publié le 24 mars 2026 sur un million de conversations échantillonnées du 5 au 12 février 2026, attribuait encore 35 % des conversations aux métiers informatiques et mathématiques. La seconde est qu'une sortie produite n'est pas une sortie utilisée : le classifieur voit ce que le modèle a rendu, pas ce que l'utilisateur en a fait ensuite, et c'est précisément là que se loge le problème traité à la section suivante.

Pourquoi le gain ressenti n'est-il pas le gain mesuré ?

Parce que la mesure porte sur le temps réellement passé et le ressenti sur l'effort perçu, et que ces deux grandeurs divergent d'une ampleur qui a été chiffrée une fois, dans les règles.

L'expérience de référence a été conduite par METR et publiée le 10 juillet 2025. Seize développeurs expérimentés, travaillant sur leurs propres dépôts de code, ont soumis 246 tâches réelles tirées de leur travail courant. Chaque tâche a été tirée au sort entre une condition avec IA autorisée et une condition sans, ce qui est le protocole qui manque à la quasi-totalité des chiffres de productivité qui circulent. Le résultat mesuré est que les tâches menées avec l'IA ont pris 19 % de temps en plus, avec un intervalle de confiance allant de 2 % à 39 %. Les mêmes participants prévoyaient au départ une accélération de 24 %, et estimaient après coup en avoir obtenu une de 20 %.

C'est de cet écart que vient le chiffre à retenir, formulé par METR lui-même dans une publication ultérieure : les participants surestimaient l'effet de l'IA sur leur temps de quarante points de pourcentage en moyenne. Il ne s'agit pas d'un biais individuel qu'un praticien attentif éviterait, mais du résultat le plus reproduit de la littérature sur l'autoévaluation, obtenu ici auprès de professionnels aguerris jugeant leur propre métier.

La suite de cette histoire mérite d'être connue, parce qu'elle est rare et qu'elle vaut leçon de méthode. METR a lancé en août 2025 une seconde expérience, avec dix développeurs de la première et quarante-sept nouveaux recrutés sur des projets plus divers, et a publié le 24 février 2026 qu'elle ne donnait pas de signal exploitable. La raison tient en une phrase : une proportion croissante de développeurs refuse désormais de participer à une étude qui leur demanderait de travailler sans IA la moitié du temps, et entre 30 % et 50 % des participants ont déclaré n'avoir pas soumis certaines tâches pour la même raison. Les estimations brutes de cette seconde vague, une accélération de 18 % chez les vétérans et de 4 % chez les nouveaux venus, portent des intervalles de confiance qui traversent zéro, ce que le laboratoire a écrit lui-même plutôt que de publier le chiffre nu.

Deux conclusions en découlent pour une direction, et aucune des deux ne dit que l'IA ne sert à rien. La première est que le gain a très probablement augmenté depuis 2025, mais que personne ne sait de combien, y compris l'équipe qui a construit l'instrument pour le savoir. La seconde est que la seule mesure crédible dont dispose une entreprise est celle qu'elle produit chez elle, sur ses propres tâches, avec un état de référence relevé avant le déploiement. Notre article sur la mesure du retour sur investissement d'un projet d'IA détaille comment construire cet état de référence sans y consacrer un trimestre.

Qu'est-ce que l'IA générative ne sait structurellement pas faire ?

Quatre choses, et ce ne sont pas des sujets interdits mais des propriétés de la tâche, ce qui change complètement la façon de s'en servir.

La liste qui circule habituellement énumère des domaines : la médecine, le droit, la comptabilité. Elle est inutilisable, parce qu'un modèle rédige très bien la synthèse d'une réunion juridique et très mal le total d'une colonne comptable, et qu'aucune frontière disciplinaire ne rend compte de cet écart. La frontière utile passe ailleurs, entre des tâches dont l'erreur se rattrape et des tâches dont l'erreur se propage.

La propriété de la tâcheCe qui se passe quand on l'ignoreLe contournement
Elle repose sur des données que le modèle n'a jamais vuesIl produit une valeur vraisemblable à la placeFournir la donnée dans la demande, et exiger la citation du passage utilisé
Elle exige que deux exécutions donnent le même résultatDeux demandes identiques empruntent des chemins différentsÉcrire une règle plutôt qu'une consigne, et réserver le modèle aux étapes de jugement
Quelqu'un doit en répondre juridiquementLa responsabilité reste entière et sans partage possibleUne relecture nominative, tracée, avant toute sortie de l'entreprise
Son erreur ne se voit pas à la relectureLa relecture valide une erreur bien présentéeUne vérification par recalcul ou par source, jamais par lecture

La première famille est la mieux connue et la moins coûteuse : un modèle interrogé sur les prix pratiqués par une entreprise, ses stocks ou l'historique d'un client répondra, puisqu'il produit du texte plausible et non du silence. Le remède est mécanique et il tient dans la façon de poser la question, en fournissant la donnée plutôt qu'en l'espérant.

La deuxième famille est le prolongement direct de ce que notre article sur la définition d'un agent IA établit à propos de la non-reproductibilité : un processus qui n'a qu'un seul chemin correct se code une fois et s'exécute gratuitement, alors que le faire décider à chaque passage revient à payer une consommation variable pour un résultat qu'une règle aurait produit sans hésiter.

La troisième famille est juridique et elle est plus large qu'on ne l'imagine. Un contenu produit sans apport créatif humain caractérisé n'est en principe pas protégeable par le droit d'auteur, en France comme en droit européen, puisque la protection suppose l'empreinte de la personnalité d'un auteur, et que seul un être humain peut être auteur. La conséquence est rarement tirée : un support commercial ou pédagogique généré tel quel n'appartient à personne, et rien n'interdit à un concurrent de le reprendre. Ce point relève de l'analyse doctrinale plus que d'un texte tranché, et il mérite l'avis d'un juriste avant toute décision engageante.

La quatrième famille est celle qui coûte le plus cher, et c'est la seule qui soit contre-intuitive. Un chiffre faux inséré dans un tableau bien composé, une référence bibliographique inventée dans une bibliographie correctement formatée, une date approximative dans un paragraphe par ailleurs exact : ces erreurs franchissent la relecture parce que la relecture vérifie la forme et que la forme est irréprochable. C'est la raison pour laquelle la vérification d'une sortie d'IA se fait par recalcul ou par retour à la source, jamais par lecture attentive, et c'est aussi ce qui explique une partie du ralentissement mesuré par METR.

Comment décider, tâche par tâche, si l'IA est la bonne réponse ?

En posant quatre questions dans l'ordre, et en s'arrêtant à la première qui reçoit une réponse défavorable, ce qui prend environ deux minutes par tâche.

Première question : le résultat attendu est-il vérifiable en moins de temps qu'il n'en faut pour le produire ? Si vérifier coûte plus cher que faire, le gain est négatif quelle que soit la qualité du modèle. C'est le cas d'un calcul long à refaire et rapide à générer, et c'est le critère qui élimine le plus de candidats.

Deuxième question : l'erreur, si elle survient, se verra-t-elle ? Une erreur visible se corrige, une erreur plausible se diffuse. Une note interne mal tournée se remarque au premier coup d'œil, un montant erroné dans une proposition commerciale ne se remarque qu'au moment où le client le relève.

Troisième question : la tâche a-t-elle un seul chemin correct ? Si oui, elle relève d'une règle ou d'un automate, pas d'un modèle. La confier à une IA revient à payer pour de l'incertitude là où il n'y en avait pas.

Quatrième question : un état de référence existe-t-il avant de commencer ? Sans le temps que la tâche prenait auparavant, mesuré et non estimé, aucune conclusion ne sera possible dans trois mois, et le débat se réglera au ressenti, c'est à dire à quarante points près.

Que change le fait de travailler depuis l'Afrique de l'Ouest ?

Rien sur les quatre propriétés, qui sont techniques, et beaucoup sur la mesure, parce qu'aucune donnée régionale n'existe pour servir de repère.

Un dirigeant français qui hésite peut se comparer à une moyenne nationale, discutable mais publiée. Un dirigeant sénégalais ou ivoirien n'a rien de tel : notre enquête sur les chiffres de l'IA en Afrique a montré qu'aucune enquête méthodologiquement solide ne mesure l'adoption de l'IA par les entreprises de la zone, et que les cinq statistiques les plus reprises sur le sujet ne résistent pas à une vérification. Cette absence a une conséquence directe et plutôt saine : la seule référence disponible est l'état de la maison avant le déploiement, ce qui est de toute façon la seule mesure qui décide de quoi que ce soit.

Le second effet est budgétaire et il durcit la première des quatre questions. Un abonnement facturé en dollars depuis une zone en parité fixe avec l'euro ajoute une commission de change et une exposition au taux, ce que détaille notre article sur le paiement des abonnements IA depuis l'Afrique de l'Ouest. Une tâche dont le gain est marginal en Europe peut donc être franchement défavorable à Dakar ou à Abidjan, à qualité de modèle rigoureusement identique.

Par quoi commencer cette semaine ?

Par une liste et un chronomètre, et rien d'autre. Trois gestes suffisent, et aucun ne demande d'ouvrir un compte payant.

Écrivez les vingt tâches que votre équipe répète le plus souvent, en les formulant par leur livrable et non par leur intitulé de poste : « produire le point hebdomadaire de trésorerie », pas « comptabilité ». Une tâche qui ne se décrit pas par un livrable ne se mesurera pas non plus.

Passez chacune aux quatre questions de la section précédente, et surlignez celles qui passent les quatre. Attendez-vous à en garder trois à six sur vingt : c'est le résultat habituel, et une liste où tout passe signale que les questions ont été posées trop gentiment.

Chronométrez les trois tâches retenues pendant une semaine, sans IA, en notant la durée réelle et non la durée estimée. Cette semaine de mesure est le seul investissement irrécupérable de tout l'exercice, et c'est aussi la seule chose qui vous permettra, dans trois mois, de répondre autre chose que « on a l'impression que ça va plus vite ». Notre guide sur la mise en route de l'IA dans une entreprise reprend cette séquence en détail, avec le calendrier des quatre-vingt-dix premiers jours.

Ce que ce guide établit tient en peu de mots : l'IA générative produit des documents, des explications et des recommandations, elle le fait à une échelle désormais mesurée, et son gain réel est inconnu de tous ceux qui ne l'ont pas mesuré chez eux. Les quatre propriétés qui disqualifient une tâche ne bougeront pas avec la prochaine génération de modèles, parce qu'elles décrivent la tâche et non l'outil. Le geste à faire n'est donc pas de choisir un outil, c'est d'ouvrir un tableur et d'y écrire vingt lignes.

À lire également

FAQ

Quelles sont les vraies limites de l'IA générative en entreprise ?

Elles tiennent en quatre propriétés de la tâche plutôt qu'en une liste de sujets : la tâche repose sur des données que le modèle n'a jamais vues, elle exige un résultat reproductible à l'identique, quelqu'un doit en répondre juridiquement, ou son erreur ne se repère pas à la relecture. Une tâche qui présente l'une de ces quatre propriétés ne se confie pas telle quelle, quel que soit le modèle employé.

L'IA fait-elle réellement gagner du temps ?

Personne ne le sait avec précision, et c'est la réponse honnête. Le seul essai contrôlé randomisé publié, mené par METR et paru le 10 juillet 2025, a mesuré 19 % de temps en plus sur des développeurs expérimentés qui croyaient avoir gagné 20 %. Le même laboratoire a écrit le 24 février 2026 que sa seconde expérience ne donnait pas de signal fiable, l'adoption généralisée de l'IA rendant le groupe de contrôle impossible à constituer.

Comment savoir si une tâche vaut la peine d'être confiée à une IA ?

Posez-vous quatre questions dans l'ordre : le résultat est-il vérifiable plus vite qu'il n'est produit, une erreur se verrait-elle, la tâche a-t-elle un seul chemin correct, et disposez-vous du temps qu'elle prend aujourd'hui. Arrêtez-vous à la première réponse défavorable. Sur vingt tâches courantes, trois à six passent généralement le filtre.

Peut-on déposer ou protéger un contenu généré par IA ?

Un contenu produit sans apport créatif humain caractérisé n'est en principe pas protégeable par le droit d'auteur, la protection supposant l'empreinte de la personnalité d'un auteur humain. Plus vous structurez, sélectionnez, réécrivez et arbitrez, plus vous consolidez une protection sur l'ensemble. Le point relevant de l'analyse doctrinale plus que d'un texte tranché, faites-le valider par un juriste avant d'engager un dépôt.

Faut-il attendre que les modèles progressent avant de se lancer ?

Non, parce que les quatre propriétés qui disqualifient une tâche décrivent la tâche et non le modèle, et qu'aucune génération future ne les fera disparaître. Attendre coûte en revanche la semaine de mesure qui vous manquera plus tard : l'état de référence d'aujourd'hui ne se reconstitue pas rétroactivement.

Combien de temps faut-il pour savoir si ça marche ?

Une semaine de mesure avant, puis quatre semaines d'usage sur trois tâches maximum. Au delà de trois tâches simultanées, plus personne ne sait à quoi attribuer un écart, et l'exercice produit une conviction au lieu d'un résultat.

Pour aller plus loin

E-book : les outils IA qui comptent en 2026

Le panorama des outils qui meritent votre attention, et de ceux qui n'en meritent pas.

Telecharger l'e-book
L'auteur

Karamo Sylla

Fondateur d'AI5D

Karamo Sylla est ingenieur et consultant en intelligence artificielle, fondateur d'AI5D. Il accompagne les dirigeants et les organisations d'Afrique de l'Ouest dans leur transformation par l'IA, de la strategie a l'execution, et il est le createur du Protocole AI5D.

Partager cet articleLinkedIn