Peut-on mesurer le ROI d'une IA sans mesurer le travail réel ?
Publié le
Les entreprises n'ont jamais autant investi dans l'IA. Les retours démontrés restent introuvables. Cet épisode passe trois idées reçues au peigne fin : le ressenti des équipes, la réduction des effectifs, les tableaux de bord — trois instruments qui mesurent autre chose que le travail. Chronomètre en main, que reste-t-il du ROI quand on regarde ce que les équipes font vraiment ?
Écouter et s’abonner
Dans cet épisode
Les directions mesurent le retour de leurs investissements d'IA avec trois instruments : le ressenti des équipes, la masse salariale, les tableaux de bord. Cet épisode les passe à l'épreuve des meilleures données de 2025 et 2026.
Pour approfondir : ROI de l’IA.
Le ressenti d'abord : dans l'essai contrôlé du laboratoire METR, des développeurs expérimentés étaient environ 20 % plus lents avec l'IA — en se croyant 20 % plus rapides. La masse salariale ensuite : selon l'enquête Gartner auprès de 350 dirigeants de grandes entreprises, huit organisations sur dix ont réduit leurs effectifs, sans corrélation avec le retour sur investissement — couper crée de la marge budgétaire, pas du retour. Les tableaux de bord enfin : l'enquête Adaptavist auprès de 2 500 travailleurs du savoir montre que plus de quatre sur dix passent plus de temps à vérifier ce que produit l'IA qu'ils n'en gagnent — un travail de reprise qu'aucune télémétrie ne voit.
Reste alors à mesurer le travail lui-même : l'épisode compare les méthodes disponibles par ce qu'elles voient et ce qu'elles ratent, jusqu'à la condition qui les départage — mesurer les tâches sans surveiller les personnes, avec un anonymat garanti par conception. Et il se ferme sur la question que toute direction devra trancher : qui décide de ce qu'une organisation a le droit de mesurer ?
Au sommaire : 00:30 Le ressenti ne mesure pas · 06:39 Couper des postes, mesurer des flux · 11:31 Mesurer le travail sans surveiller les personnes.
Sources : METR, essai contrôlé randomisé, juillet 2025 — https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/ · Gartner, enquête T3 2025, mai 2026 — https://www.gartner.com/en/newsroom/press-releases/2026-05-05-gartner-says-autonomous-business-and-artificial-intelligence-layoffs-may-create-budget-room-but-do-not-deliver-returns · Adaptavist via Attest, mars 2026 — https://www.adaptavist.com/blog/what-is-the-human-cost-of-ai-transformatio
Transcription de l’épisode
Bienvenue dans ce nouvel épisode des Signaux du changement.
Les entreprises n'ont jamais autant investi dans l'intelligence artificielle. Et les retours démontrés restent introuvables. Alors la question de cet épisode se pose à la racine : peut-on mesurer le retour d'une IA sans mesurer le travail réel ?
Deux analystes passent trois idées reçues au peigne fin : le ressenti des équipes, la réduction des effectifs, les tableaux de bord.
Bonne écoute.
— Imaginez l'organisation multinationale classique… Les budgets viennent d'être votés, les serveurs tournent à plein régime…
— Mm mm.
— Les licences logicielles sont déployées partout et… le conseil d'administration applaudit cette vision très moderne : l'investissement dans l'intelligence artificielle est massif.
— Ouais, l'enthousiasme général quoi.
— Voilà. Mais quelques trimestres plus tard, la direction financière ouvre ses registres pour chercher la trace concrète, le retour mesurable de cet investissement, et là…
— Absolument rien.
— C'est ça, le vide total. Ce qui nous amène directement à notre question centrale pour cette exploration : est-ce qu'on peut vraiment mesurer le retour d'une IA sans mesurer le travail réel ?
— Bah c'est vraiment la question de fond qui hante les couloirs des directions générales en ce moment, tu vois.
— Ouais.
— Et cette scène du registre financier vide qu'on vient de décrire, c'est pas une exception, c'est même devenu la norme.
— Le paradoxe est assez net : on observe une pression importante sur les organisations pour adopter ces capacités autonomes par peur de rater le virage technologique.
— Exactement.
— Donc on valide des dépenses conséquentes en infrastructures, en formation… L'effort financier crève le plafond, mais les résultats tangibles sur le compte de résultat restent introuvables. Le décalage est, disons, très profond.
— C'est une situation d'une gravité inédite. Quand on regarde les données institutionnelles qui documentent ça, la RAND par exemple a analysé la trajectoire de ces initiatives.
— Et le constat est sévère, non ?
— Il est sévère. La grande majorité de ces projets échouent, et ce qui doit alerter les dirigeants, c'est que la fréquence de ces échecs dépasse largement tout ce que l'industrie a connu avec les projets informatiques classiques.
— D'accord, on n'est pas juste sur de la friction d'adoption habituelle.
— Non, pas du tout. Déployer un logiciel traditionnel, ça coince toujours un peu au début, certes, mais là les projets s'enlisent ou s'effondrent à un rythme assez alarmant.
— Ce qui rejoint, je crois, la récente étude préliminaire du MIT. Même si elle fait l'objet de débats, son observation centrale reste incontournable : les pilotes expérimentaux réussissent bien en laboratoire, mais presque aucun ne survit au passage à l'échelle.
— Tout à fait. En environnement contrôlé, sur des données parfaitement nettoyées, la technologie brille. Mais dès qu'on essaie d'intégrer ce pilote dans le désordre de la réalité opérationnelle, bah le retour sur investissement s'évapore.
— Et la conséquence directe, on la voit sur le terrain, c'est l'abandon pur et simple : les organisations débranchent massivement leurs expérimentations en cours de route. La direction finit par couper les vivres pour limiter la casse.
— Ce qui nous amène vraiment au cœur de notre échange : pourquoi les directions se retrouvent systématiquement dans cette impasse ? La faille n'est pas forcément dans la technologie elle-même.
— Elle est dans la manière de l'évaluer.
— Exactement. Les organisations pilotent cette transformation avec des outils inadaptés.
— Alors, explorons justement ces instruments classiques. Traditionnellement, les directions s'appuient sur le ressenti des équipes, sur l'évolution de la masse salariale et sur les tableaux de bord numériques. Analysons pourquoi ces instruments renvoient une image déformée de la réalité, en commençant par l'objection du ressenti.
— Mm.
— Si les projets échouent, pourquoi les équipes interrogées en interne affirment souvent se sentir plus productives avec ces nouveaux outils ?
— C'est une illusion d'optique redoutable. L'outil génère du contenu de manière extrêmement fluide, et ça, ça masque complètement l'effort global requis pour finaliser une tâche.
— J'aime beaucoup utiliser une analogie pour ce phénomène. Se fier au ressenti des équipes pour mesurer l'IA, c'est un peu comme conduire un véhicule sans regarder le compteur de vitesse.
— Ouais, on se fie juste à l'accélération.
— C'est ça, l'outil génère un texte ou du code instantanément. La personne devant son écran ressent une forte accélération parce que la page se remplit sans effort de frappe. Mais cette impression de vélocité, enfin ça ne dit absolument rien de la justesse de la direction prise.
— L'essai contrôlé du laboratoire METR vient objectiver cette sensation de manière assez implacable. Ils ont mesuré ça avec une précision clinique.
— Dans quel contexte exactement ?
— Le contexte est crucial, ouais. L'étude portait sur des développeurs travaillant sur des projets open source. C'est-à-dire des professionnels très expérimentés manipulant leur propre code avec des outils génératifs récents.
— Attends, je t'arrête sur ce point : ce sont des experts techniques de haut niveau sur un environnement qu'ils maîtrisent parfaitement. S'ils utilisent un outil pour accélérer, leur ressenti devrait être fiable, non ?
— Bah c'est là que le constat devient frappant. Chronomètre en main, sous observation stricte, ces développeurs étaient environ 20 % plus lents lorsqu'ils utilisaient l'intelligence artificielle.
— 20 % plus lents. D'accord.
— Mais — et c'est la donnée fondamentale —, quand on les interrogeait sur leur propre perception, ils se croyaient 20 % plus rapides.
— Ah oui, le décalage entre la réalité chronométrée et la perception psychologique est absolu ! Mais comment le cerveau humain peut-il se tromper à ce point ?
— Tout s'explique par le changement de la nature de la charge cognitive. Le cerveau enregistre avec grand soulagement la fin de l'effort de création initial. Le syndrome de la page blanche disparaît, tu vois.
— Mm mm, l'effort musculaire ou intellectuel de départ n'est plus là.
— Voilà. Sauf que l'effort ne s'évapore pas, il se déplace. Ce qui était de la production active devient de la supervision passive. Le développeur doit déboguer, comprendre une logique générée par une machine. Et l'esprit humain est très mal équipé pour évaluer le temps passé à chercher des erreurs dans un raisonnement qu'il n'a pas lui-même construit.
— Je comprends mieux. Quand on rédige soi-même, on sent le temps passé. Mais lire un texte ou un code qui semble correct à première vue, ça plonge le cerveau dans un état d'attention un peu flottante, on perd la notion du temps.
— C'est exactement le mécanisme. La relecture critique fatigue le jugement de manière insidieuse. L'outil supprime la friction de la création, mais introduit une friction importante dans l'intégration et la validation.
— Bon, on pourrait quand même soulever une limite méthodologique sur l'étude METR : elle cible des ingénieurs logiciels, un profil où une simple virgule mal placée ruine tout le système. Est-ce que ce constat s'applique à d'autres professions ?
— La nature du travail varie, c'est sûr. Mais la leçon de fond reste universelle : qu'on observe un analyste financier, un juriste ou un marqueteur, la perception humaine échoue à mesurer le vrai travail.
— Le confort de l'interface soulage l'anxiété en fait.
— Exactement. Le ressenti mesure un soulagement psychologique, absolument pas une performance de production.
Ce qu'on vient d'entendre tient en une phrase : quand on demande aux équipes si l'IA les rend plus productives, leur réponse mesure leur confort, pas leur production. Le chronomètre, lui, dit souvent l'inverse.
Deuxième idée reçue, celle des directions financières : si l'intelligence artificielle remplace des postes, l'économie réalisée serait le retour sur investissement. Voyons ce que les enquêtes en disent.
— Fermons donc la porte du ressenti subjectif. Mais mettons-nous un instant à la place d'une direction financière : l'objection mécanique tombe souvent si l'organisation coupe des postes parce que l'IA absorbe des tâches. Ça crée un retour sur investissement : les dépenses diminuent, le profit augmente.
— Difficile à attaquer en théorie, ouais.
— C'est très intuitif sur un tableau Excel.
— Sauf que c'est systématiquement démenti par le terrain. Les enquêtes auprès des décideurs déconstruisent cette équation simpliste. Regardons l'enquête Gartner qui a interrogé des dirigeants mondiaux au sein de très grandes entreprises.
— Celles qui pilotent des capacités autonomes, c'est bien ça ?
— Tout à fait. Et le mouvement de réduction des coûts est bien là : huit organisations sur dix ont effectivement réduit leurs effectifs en lien avec ces déploiements technologiques.
— La réduction des effectifs est donc une réalité brute. Pourquoi Gartner affirme que cette stratégie ne fonctionne pas alors que l'argent est économisé ?
— Parce que couper un budget, c'est pas synonyme de création de valeur. L'analyste de Gartner souligne une distinction capitale : réduire les effectifs crée de la marge budgétaire, pas du retour sur investissement. Ces réductions de personnel ne sont absolument pas corrélées à un retour sur investissement élevé.
— Il faut creuser ça, c'est très contre-intuitif. Supprimer des postes allège les dépenses opérationnelles, donc le bilan s'améliore à court terme.
— À très court terme, oui. Mais le véritable retour exige qu'un capital déployé génère une capacité globale de production supérieure. L'organisation doit faire plus ou faire mieux, durablement.
— Hm.
— Or, on vient de voir que l'outil exige un travail très lourd de supervision. Si l'organisation supprime des postes, cette charge de correction retombe sur qui ? Sur les collaborateurs restants.
— Ah, le piège se referme ! Les employés qui restent font leur propre travail plus le travail de supervision de la machine pour compenser l'absence de leurs anciens collègues.
— C'est ça. L'organisation ne gagne aucune capacité supplémentaire, elle épuise juste ses équipes.
— Donc la réduction aveugle des effectifs détruit la capacité de production réelle. Mais les organisations qui sortent gagnantes, elles font quoi ?
— Le constat paradoxal de Gartner, c'est que les gagnants ne soustraient pas de la main-d'œuvre. Ils investissent dans les personnes.
— D'accord.
— Ils réallouent le temps gagné pour élever le niveau d'exigence, traiter des problèmes plus complexes. C'est cette montée en compétences qui justifie l'investissement initial.
— L'objection financière est donc écartée. Mais si je suis un dirigeant qui cherche des certitudes, il me reste la mesure technique : les tableaux de bord, la télémétrie… On analyse les connexions, les requêtes aux serveurs.
— L'attrait de la télémétrie est très puissant, ça offre une illusion de contrôle. Les graphiques sont rassurants, mais il y a un angle mort majeur.
— Lequel ?
— La télémétrie capte l'exécution technique de la machine, mais elle est totalement aveugle au temps de vérification humaine qui suit. L'enquête Adaptavist documente ça clairement.
— Auprès de qui ?
— Une vaste cohorte de travailleurs du savoir en Europe et en Amérique du Nord. Et ça révèle l'ampleur du travail invisible : plus de quatre sur dix passent plus de temps à vérifier ce que produit l'intelligence artificielle qu'ils n'en gagnent lors de la création.
— Plus de temps à vérifier qu'à créer… Prenons un scénario du quotidien pour ancrer ça : imagine la rédaction d'un cahier des charges complexe. L'outil génère un brouillon structuré instantanément.
— Mm mm.
— Du point de vue de la direction, le voyant de productivité clignote au vert, l'opération est un succès technique.
— Mais sur le terrain, le vrai travail commence à peine. Il faut reprendre tout le document, chasser les hallucinations de la machine, s'assurer de la cohérence logique, il faut adapter la tonalité aux standards de l'entreprise…
— Et vérifier les enjeux de confidentialité aussi !
— Exactement, s'assurer qu'aucune information stratégique n'a été exposée ou mal interprétée.
— Et tout ce temps passé à réparer la sortie générée, bah ça échappe aux métriques officielles. Le système compte la matière première produite, mais ignore l'effort d'usinage. Sans parler de l'informatique fantôme, le shadow IT.
— Ah oui, l'informatique fantôme fausse encore plus la mesure. Une part importante des usages réels se déroule hors des clous.
— Sur des navigateurs personnels, des outils grand public…
— Ouais, pour contourner la lenteur des systèmes internes. Donc les tableaux de bord ne voient même pas une grande partie de l'usage réel.
— Si on combine l'angle mort de la réparation et l'invisibilité de l'informatique fantôme, le temps passé à rendre une information exploitable annule purement et simplement le temps gagné à la produire.
— C'est l'échec fondamental de la télémétrie pure. C'est comme mesurer parfaitement la vitesse de rotation du moteur tout en ignorant si les roues patinent dans le vide.
Les trois premiers instruments viennent de montrer leurs limites. Il en reste un à examiner, le plus délicat : mesurer le travail lui-même, directement.
Délicat, parce que la frontière est fine entre mesurer ce que les équipes font et surveiller les personnes qui le font. Toute la dernière partie tient dans cette différence.
— Faisons le point sur le chemin parcouru. Les instruments classiques sont inopérants : le ressenti ment, la réduction des effectifs confond marge budgétaire éphémère et vrai retour, et la télémétrie ignore la réparation humaine.
— Hm.
— La question revient donc : comment mesure-t-on le vrai travail ?
— Il faut comparer de manière critique les grandes approches disponibles, observer ce qu'elles voient et surtout ce qu'elles ratent. D'abord, l'observation directe.
— L'étude des temps et des clics. Ça cartographie l'activité physique.
— Oui, mais ça rate l'intégralité de la charge cognitive. Observer un analyste fixé à un écran ne dit rien de la complexité du problème qu'il résout.
— Ensuite, on a l'exploration des processus virtuels, le process mining…
— Qui aspire les traces numériques dans les logiciels métiers. Le système voit l'ouverture du dossier, la transmission, la clôture.
— Je suis pas certaine de l'efficacité de ça, ça me fait penser au suivi d'un colis postal.
— Comment ça ?
— Ben le système t'indique quand le colis quitte l'entrepôt et quand il est livré. Sur l'écran, c'est parfait. Mais ça ignore totalement que le livreur a dû appeler le client à plusieurs reprises, contourner une barrière, négocier avec un voisin sous la pluie… L'exploration des processus reconstruit une version idéalisée, elle ignore les micro-adaptations humaines réelles.
— C'est une analogie redoutablement précise. C'est exactement son angle mort. Reste alors l'ultime approche : la télémétrie comportementale avancée. Captures d'écran automatisées, analyse du clavier, surveillance de la fenêtre active…
— L'approche qui ambitionne de tout voir.
— Et c'est justement sa faille mortelle. En voulant scruter chaque micro-comportement, la mesure glisse irrémédiablement vers la surveillance généralisée des personnes.
— Ce qui s'autodétruit en fait ! Dès qu'un comportement humain se sait surveillé par un algorithme, il se modifie pour satisfaire à l'indicateur.
— Les collaborateurs vont simuler de l'activité, générer des mouvements de souris juste pour garder la jauge dans le vert. La pression détruit la validité de l'information. Le thermomètre fausse la température.
— Alors si l'observation est aveugle au mental, si l'exploration des processus vit dans le déni, et si la surveillance détruit l'authenticité… Quelle est la voie alternative ?
— Le changement de paradigme, c'est d'arrêter de traquer la machine ou d'espionner le comportement, et d'écouter directement la source de la friction. Un principe d'écoute basé sur les collaborateurs eux-mêmes.
— Leur demander ce que pèsent réellement leurs tâches.
— Voilà. Interroger la lourdeur des processus, l'effort d'intégration, la difficulté à superviser les erreurs… Reconnaître que la connaissance intime de la réalité opérationnelle réside chez la personne qui exécute la tâche.
— La démarche est logique. Mais soyons pragmatiques : poser des questions, c'est pas nouveau, et personne n'a envie de critiquer ouvertement l'investissement phare du conseil d'administration.
— Non, bien sûr.
— Donc l'écoute ne peut fonctionner qu'à une condition technique inflexible : l'anonymat ne doit en aucun cas reposer sur une simple promesse managériale ou une charte.
— C'est vital. Si le système repose sur la confiance envers la hiérarchie pour ne pas regarder qui a dit quoi, c'est un échec garanti. L'anonymat doit être garanti par conception.
— Par conception ou par l'architecture même du système de collecte ! La rupture entre l'identité et le retour d'expérience doit être ancrée dans la structure technique.
— Exactement. Si l'anonymat n'est pas assuré par l'architecture, on bascule dans les travers de la surveillance. Les collaborateurs vont lisser leurs retours pour ne froisser personne, la friction redeviendra invisible, l'organisation perdra sa boussole. C'est un prérequis absolu pour une donnée juste.
— Nous arrivons au terme de notre analyse. Les dirigeants qui nous écoutent et s'interrogent sur leurs investissements doivent tirer une conclusion de ces constats : un retour calculé sans mesurer le travail brut tel qu'il est vécu sur le terrain ne mesure en fait qu'une dépense.
— Ouais.
— L'organisation empile les coûts de licence, les frais d'infrastructure, mais elle gère uniquement son budget, elle ne pilote absolument pas sa capacité de production.
— Cette conclusion impose vraiment un changement de posture profond. Il y a des exigences fondamentales pour piloter ces transformations. D'abord, cibler impérativement les tâches et s'interdire de mesurer les personnes.
— Mesurer l'humain déclenche l'autodéfense et la dissimulation.
— Tout à fait, ça installe une compétition toxique. Mesurer la tâche permet d'isoler objectivement les processus cassés et le temps gaspillé à corriger les machines. L'objectif, c'est d'optimiser le système, pas d'évaluer l'individu.
— L'autre exigence concerne les instruments choisis par les organisations : il faut sélectionner des approches qui préservent le contrat de confiance avec les équipes.
— C'est systémique. Un instrument qui érode la confiance faussera inéluctablement la réalité qu'il tente de capter. La donnée devient artificielle, juste là pour rassurer le management intermédiaire.
— Et la boucle de l'échec technologique s'autoalimente indéfiniment.
— Au final, cette exploration des rouages de la productivité soulève une question beaucoup plus large, une question un peu philosophique qui dépasse l'évaluation des budgets pour toucher aux fondations de l'entreprise moderne : qui décide de ce qu'une organisation a le droit de mesurer ?
Les signaux du changement est un podcast de Spentia.
Mesurer ce que pèsent les tâches et ce à quoi les équipes tiennent, sans jamais mesurer les personnes : c'est notre travail auprès des directions, avec une méthode d'écoute anonyme par conception. Le lien est dans les notes de l'épisode.
Si cette analyse vous a été utile, elle se partage bien avec un dirigeant qui calcule un retour sur investissement en ce moment.
À bientôt pour un prochain signal.