← Toutes les actualités
Presse · 5 octobre 2026 · 14 min de lecture

Quand votre agent IA se contredit, le stabiliser peut masquer deux documents qui se contredisent

Quand votre agent IA se contredit, le stabiliser peut masquer deux documents qui se contredisent

Deux réponses à la même question : la cause peut être le modèle, la recherche ou deux documents contradictoires. Le relevé de doubles réponses les distingue.

Quand un agent IA donne deux réponses différentes à la même question, il est tentant de chercher la cause dans le modèle : réglage d’échantillonnage, consigne, découpage des documents. Elle peut se trouver un étage plus bas, dans deux documents de l’entreprise qui disent deux choses et que l’agent cite tour à tour. Dans ce cas, des réponses incohérentes d’un agent IA sont héritées du corpus plutôt que produites par le moteur. Et le réglage qui les fait disparaître a un effet que personne n’a demandé : un ingénieur choisit, sans le savoir, lequel des deux documents l’entreprise applique.

Cet article s’adresse au CDO, au CTO ou au responsable de la gestion des connaissances d’un grand groupe dont un agent ou un assistant interne répond déjà à des collaborateurs à partir du patrimoine documentaire. Il propose un diagnostic en trois étages, modèle, recherche, corpus, dont seul le dernier échappe à l’outillage de l’équipe IA. Si votre agent ne cite pas ses sources, l’argument s’appliquera le jour où cette traçabilité sera ouverte.

La personne pour qui ce texte est inconfortable est la responsable produit de l’agent. Disons celle de l’assistant RH d’un groupe industriel. En revue mensuelle, une responsable RH projette deux captures. Même question, posée à quelques jours d’intervalle par deux managers : un cadre au forfait peut-il télétravailler le vendredi ? La première réponse dit que l’accord du manager suffit. La seconde ajoute une validation par les RH. La responsable produit a déjà passé plusieurs semaines sur ce cas : consigne réécrite, réglage abaissé, découpage revu. Ce jour-là, quelqu’un ouvre enfin les deux sources citées. L’une est l’accord télétravail initial, l’autre l’avenant qui l’a modifié. Les deux sont en ligne.

Le geste que propose cet article ne coûte rien. Pour chaque question qui a donné deux réponses ce mois-ci, ouvrez les sources citées par chacune avant de toucher au modèle. Le résultat prend la forme d’un artefact décrit plus bas, le relevé de doubles réponses.

Deux réflexes viennent spontanément. Le premier est la routine de l’équipe IA : régler le modèle et la recherche jusqu’à ce que la réponse se stabilise. Le second est l’outil déjà acheté : la plateforme d’évaluation des agents, qui mesure la cohérence en rejouant des questions, ou la GED, qui gère les versions des documents. Ces trois moyens travaillent sur les réponses ou sur les versions ; ouvrir les deux sources citées pour voir si elles se contredisent ne fait partie d’aucun. Le 23 septembre, nous expliquions jusqu’où portent les outils de détection de contradictions ; le 2 octobre, que l’équipe IA compense par des consignes ce qu’elle ne remonte pas au rédacteur. Cet article se place avant ces deux moments : au diagnostic, quand une incohérence apparaît et que personne ne sait encore d’où elle vient.

Ce que l’on appelle la cohérence d’un agent, et ses trois causes

Les analystes ont fait de la fiabilité la condition de l’autonomie des agents. Dans un webinaire enregistré le 23 septembre 2026, Gartner pose que l’autonomie d’un agent se gagne par une fiabilité démontrée, relève que les technologies sous-jacentes se comportent de façon inégale d’une tâche à l’autre, et propose d’améliorer la fiabilité « au-delà du modèle lui-même », par la conception de l’agent, son environnement d’exploitation et la supervision humaine.

La cohérence en est le critère le plus simple à mesurer : on pose la même question plusieurs fois, ou sous deux formulations voisines, et on compare les réponses. Le résultat est un constat sur les sorties de l’agent. Il ne dit rien de la cause, et trois étages peuvent la produire.

Le premier est le modèle. Un grand modèle de langage n’est pas strictement reproductible, même réglé pour l’être : des travaux publiés en septembre 2025 par le laboratoire Thinking Machines ont montré que la façon dont les serveurs regroupent les requêtes suffit à faire varier une réponse. Ce défaut est réel et se traite côté moteur.

Le deuxième est la recherche. Deux formulations voisines d’une même question peuvent faire remonter deux passages différents, exacts et compatibles entre eux. La réponse change de forme sans changer de fond, ou devient partielle. Ce défaut se traite par la recherche et le découpage.

Le troisième est le corpus. Deux documents en ligne affirment deux choses incompatibles sur la même question. L’agent cite l’un ou l’autre selon ce qui remonte, et son incohérence reproduit fidèlement celle du patrimoine. Les travaux de Google Research publiés en 2025 sur les conflits entre sources montrent que les modèles gèrent mal ces situations, et qu’ils répondent mieux quand on les avertit explicitement du conflit. La conséquence pour un acheteur tient en une phrase : le modèle ne peut pas arbitrer un désaccord que l’entreprise n’a pas arbitré.

La position que nous défendons est indépendante de ces publications. La couche documentaire précède le moteur, quel que soit le cadre de fiabilité qu’un analyste publie ce trimestre.

Ce que les réglages corrigent, et ce qu’ils masquent

Il faut décrire l’outillage existant dans sa meilleure forme. Une plateforme d’évaluation sérieuse rejoue un jeu de questions de référence, compare les réponses, signale les écarts et vérifie l’effet de chaque réglage. Une équipe IA compétente sait réduire la variabilité du modèle, stabiliser la recherche, épingler une source. Une GED bien tenue sait quelle version d’un document est la plus récente.

Leur frontière est précise. La plateforme d’évaluation constate l’écart sur les sorties sans ouvrir les documents cités. La GED gère les versions d’un même document et ignore qu’un avenant contredit un accord rangé dans un autre dossier. Les réglages, eux, produisent une constance qui peut tromper : quand l’équipe épingle l’avenant ou exclut l’accord initial, l’agent répond toujours la même chose, et c’est un ingénieur qui a choisi la règle appliquée, sans le savoir.

C’est à cette frontière que la responsable produit réapparaît. Les semaines passées sur le cas du télétravail ont servi l’agent : il répond désormais toujours la même chose. Elle ignore seulement si cette réponse est la bonne, et l’accord initial reste en ligne, ouvert tel quel par les managers qui le consultent directement.

Une autre discipline a réglé cette question depuis longtemps. Le Vocabulaire international de métrologie distingue la dispersion due à l’instrument de l’incertitude dite définitionnelle, qui tient au manque de précision dans la définition de ce que l’on mesure. Cette incertitude fixe un plancher : aucun instrument, si précis soit-il, ne descendra en dessous. Un agent interrogé sur une règle définie par deux documents contradictoires est dans cette situation, et changer de modèle revient à changer d’instrument. La transposition porte sur la méthode, séparer la dispersion de l’instrument de celle de la définition, et non sur l’objet : il ne s’agit pas de certifier un corpus, et la fonction métrologie n’est pas destinataire de ce texte.

Réponses incohérentes d’un agent IA : le relevé de doubles réponses

Le geste de l’introduction produit un artefact, le relevé de doubles réponses. C’est le seul nom nouveau de cet article.

Ce qu’il contient. Une ligne par question ayant reçu deux réponses incompatibles : la question, reformulée sans identifiant d’utilisateur ni donnée client ; la première réponse et ses sources citées ; la seconde et ses sources citées ; le cas de triage ; la suite donnée et sa date.

Son domicile. Le jeu de questions de référence que l’équipe IA maintient déjà pour ses tests, dans sa plateforme d’évaluation ou, à défaut, dans un fichier partagé. Le relevé y ajoute deux colonnes, « sources citées par chaque réponse » et « cas de triage ». Il est tenu par l’équipe qui exploite l’agent.

Le moment où ses premières lignes s’écrivent. Au prochain passage programmé du jeu de questions de référence, avant tout changement de réglage. Jamais au moment où l’équipe règle déjà le modèle pour faire disparaître l’écart : c’est précisément le moment où la cause cesse d’être visible.

Une ligne remplie. Question : un cadre au forfait peut-il télétravailler le vendredi ? Première réponse : oui, avec l’accord du manager ; source citée : accord télétravail, version initiale, article sur les jours éligibles. Seconde réponse : oui, après validation RH ; source citée : avenant à l’accord télétravail. Cas de triage : sources différentes et contradictoires. Suite : transmis au service RH rédacteur, aucun réglage modifié, en attente.

Sa règle de lecture. Chaque ligne relève de l’un des trois cas. Mêmes sources et réponses différentes : la variabilité vient du modèle, et le réglage est légitime. Sources différentes mais compatibles : la recherche est en cause, et le découpage ou la remontée se travaillent. Sources différentes et contradictoires : le corpus est en cause, et aucun réglage ne doit choisir entre les deux documents avant que le service rédacteur ait indiqué lequel s’applique. En attendant, une consigne fait dire à l’agent que deux documents divergent sur ce point, cite les deux et oriente vers le service concerné. Après un mois, si la plupart des lignes relèvent des deux premiers cas, l’équipe IA travaille au bon étage. Si une part visible relève du troisième, une partie de son travail de réglage compense des documents.

Son mode d’échec. Si l’exercice réussit, l’équipe IA découvre qu’une partie de ses tickets de réglage relevait du corpus, et doit en transmettre certains à des services qui ne les attendaient pas. C’est son coût : le temps d’ouvrir deux sources par cas. Si l’agent ne cite pas ses sources, l’exercice échoue immédiatement, et ce constat est en soi un résultat : la cohérence de cet agent ne peut pas être diagnostiquée.

La pièce qu’il crée. Une ligne classée « contradictoire » établit qu’à une date donnée, l’entreprise savait que deux de ses documents se contredisaient sur une règle appliquée à ses collaborateurs. C’est notre lecture, sans décision publiée à l’appui, qu’une trace suivie d’une transmission datée reste préférable à un réglage silencieux qui fait disparaître l’écart sans le résoudre. La portée d’une telle pièce dépend de votre contexte : l’avis de votre direction juridique s’impose avant d’en faire une règle de groupe, et celui du DPO avant d’y faire figurer la moindre question d’utilisateur.

Le relevé ne crée aucun poste et s’adosse au budget d’exploitation de l’agent, qui finance déjà le jeu de questions de référence. La contrepartie est une dépendance : si la plateforme d’évaluation change, les deux colonnes doivent être reprises dans la suivante.

Ce qu’un terrain réel a montré, et ce qu’il n’établit pas

Sur le corpus technique d’un acteur européen de l’énergie et de l’industrie, un diagnostic K-AI a détecté 398 conflits documentaires : versions concurrentes d’une même procédure, incohérences entre directions. Leur traitement ciblé s’est accompagné d’une amélioration de la fiabilité des réponses IA, mesurée sur ce périmètre.

La frontière de cette preuve doit être dite. Elle établit qu’un corpus technique réel peut porter plusieurs centaines de contradictions, et que leur traitement a pesé sur la fiabilité des réponses. Elle ne mesure pas la cohérence au sens de cet article, la même question rejouée deux fois, et elle ne dit pas quelle part des incohérences d’un agent vient du corpus plutôt que du modèle. Le relevé de doubles réponses sert précisément à instruire cette question sur votre propre agent.

Ce que la DKP ajoute, et où elle s’arrête

Une Document Knowledge Platform (DKP) est la couche de qualité et de gouvernance documentaire qui s’exécute en amont des systèmes d’IA : elle gouverne le patrimoine (Govern), détecte et traite anomalies, doublons, obsolescences et contradictions (Clean), puis n’active le corpus auprès des agents qu’une fois ces deux étapes tenues (Activate). Elle ne remplace ni l’agent, ni la plateforme d’évaluation, ni la GED. Elle ne se vend pas comme un outil d’observabilité ou d’évaluation des modèles et n’a pas vocation à figurer dans un appel d’offres de ces catégories. La cohérence mesurée sur les sorties est seulement le canal par lequel le problème documentaire devient visible.

Sa contribution au relevé tient au troisième cas. Une ligne « contradictoire » désigne deux documents. La DKP compte les autres documents du patrimoine qui portent la même affirmation ou son contraire, pour que la correction de l’avenant n’oublie pas la fiche pratique qui reprenait l’accord initial. C’est son unité de travail propre, la contradiction dénombrée à travers les documents, que ni l’évaluation des sorties ni la gestion des versions ne produisent.

K-AI répond du dénombrement, de sa reproductibilité et du routage de chaque cas vers le service concerné, avec un diagnostic préparé. Le choix du document qui s’applique reste au métier. Sur le plan technique, l’analyse porte uniquement sur les contenus documentaires désignés, dans un périmètre d’ingestion contractuel. Les questions des utilisateurs, les réponses de l’agent et ses journaux restent dans vos outils, car la DKP n’en a pas besoin pour compter les contradictions. Aucune donnée n’est réutilisée pour entraîner des modèles.

Et si vous ne faites rien

Le statu quo a un résultat prévisible. L’équipe IA continuera de stabiliser l’agent cas par cas, chaque réglage choisissant silencieusement un document contre un autre. L’agent paraîtra plus constant à chaque revue, et le corpus restera aussi contradictoire qu’avant, lu tel quel par tous ceux qui l’ouvrent sans passer par l’agent.

Conclusion : auditer, nettoyer, surveiller

Auditer : pour chaque question qui a donné deux réponses ce mois-ci, ouvrir les sources citées par chacune et classer le cas. Nettoyer : transmettre les cas contradictoires au service rédacteur, et traiter avec lui les autres documents qui portent la même contradiction. Surveiller : faire du relevé une étape écrite de chaque passage du jeu de questions de référence, pour que l’incohérence soit diagnostiquée avant d’être réglée.

À la revue suivante, la responsable produit de l’assistant RH ne projettera plus deux captures. Elle présentera une ligne classée « contradictoire », la réponse du service RH sur le document qui s’applique, et un réglage qu’elle n’a pas eu besoin de faire.

Foire aux questions

Pourquoi un agent IA donne-t-il deux réponses différentes à la même question ?

Trois causes sont possibles : la variabilité du modèle lui-même, une recherche qui remonte des passages différents selon la formulation, ou deux documents du corpus qui se contredisent. Seule la lecture des sources citées par chaque réponse permet de distinguer ces cas.

Régler la température du modèle à zéro suffit-il à rendre un agent cohérent ?

Ce réglage réduit la variabilité du modèle, sans garantir une reproductibilité parfaite. Quand deux documents se contredisent, il rend l’agent plus constant dans le choix de l’un des deux, sans que personne ait décidé lequel s’applique.

Notre plateforme d’évaluation mesure déjà la cohérence. Que manque-t-il ?

Elle mesure l’écart entre les réponses. Le relevé de doubles réponses ajoute la lecture des sources citées et le classement du cas, ce qui dit à quel étage agir : modèle, recherche ou corpus.

Que doit répondre l’agent tant que la contradiction n’est pas résolue ?

Le plus prudent est qu’il signale la divergence, cite les deux documents et oriente vers le service concerné. Choisir l’un des deux en silence revient à appliquer une règle que personne n’a validée.

Que faire si notre agent ne cite pas ses sources ?

Le diagnostic est alors impossible, et c’est le premier point à corriger. Sans citation, une incohérence héritée du corpus et une incohérence produite par le modèle sont indiscernables.

Quel est le cadre de confidentialité d’un examen du patrimoine documentaire ?

Le périmètre d’ingestion est contractuel et limité aux contenus documentaires désignés, à l’exclusion des questions des utilisateurs, des journaux d’usage et de la télémétrie. Aucune donnée n’est réutilisée pour entraîner des modèles. Le périmètre est validé conjointement par le Document Owner métier et le RSSI ou le DPO, jamais par la seule DSI.

Sources


Pour aller plus loin

K-AI Corpus Diagnostic — 10 jours ouvrés, rapport complet des 20 anomalies les plus critiques de votre référentiel documentaire, garantie remboursement si aucune anomalie valable n’est détectée. Un échange d’une heure peut partir de quelques lignes de votre relevé de doubles réponses : on regarde ensemble, pour chaque cas contradictoire, combien d’autres documents portent la même affirmation ou son contraire, et vers quel service orienter chaque cas. Contactez l’équipe K-AI : contact@k-ai.ai. Le périmètre de chaque diagnostic est validé conjointement par le Document Owner métier et le RSSI/DPO, jamais par la seule DSI.

K-AI accompagne déjà CMA CGM, Veolia, PwC, BNP Paribas, TotalEnergies et CEVA Logistics. Partenaires : AWS, Snowflake, Microsoft, Wavestone, Devoteam.

Et chez vous, quel est votre patrimoine documentaire ?

30 minutes avec un fondateur. On audite gratuitement un échantillon de vos documents et on vous montre exactement ce que K-AI détecte.

Demander une démo → Lire d’autres articles