Claude, ChatGPT, Gemini : pourquoi ils mentent comme des arracheurs de dents en fin de discussion ?

Vous avez lancé une discussion animée avec votre assistant IA préféré, et soudain, les réponses partent en vrille. Ce phénomène frustrant n’est plus un secret pour les geeks habitués à ChatGPT, Gemini ou Claude. Une recherche menée par Microsoft Research et Salesforce met des chiffres précis sur cette faiblesse structurelle des modèles actuels.

Des performances qui s’effondrent en multi-échanges

Les experts ont passé au crible plus de 200 000 interactions simulées avec les meilleurs modèles du marché : GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, DeepSeek R1, OpenAI o3 et Llama 4. Sur une question isolée, les leaders atteignent près de 90 % de succès. Mais dès que le dialogue s’allonge, le taux plonge à 65 %, soit une dégrésadation de 25 points. L’instabilité explose même de 112 % dans les échanges complexes, rendant les réponses imprévisibles – parfaite un coup, aberrante le suivant.

Pas besoin d’une épopée de 20 messages : la chute commence dès le deuxième tour. Les longueurs de réponses gonflent aussi de 20 à 300 %, favorisant les hallucinations – ces inventions factices qui plombent la crédibilité.

Les mécanismes cachés derrière ces bugs

Les modèles anticipent trop tôt votre saisie, produisant des drafts hâtifs et erronés. Pire, ils s’appuient aveuglément sur leur première sortie comme socle, propageant les fautes au fil des tours. Même si la compétence intrinsèque ne faiblit que de 15 %, cette rigidité rend les outils inutiles pour des usages précis.

Des risques concrets pour les fans de gaming et pop culture

Imaginez utiliser ces IA pour créer du lore personnalisé dans un univers comme Star Wars ou pour générer des quêtes D&D : une session prolongée, et votre épique vire au n’importe quoi. En gaming, où 50 % des studios intègrent déjà l’IA pour des PNJ dynamiques ou des narrations adaptatives, ces failles menacent l’immersion. Des PNJ qui déraillent pourraient ruiner des heures de jeu, comme un moddeur qui perd son build optimal après quelques ajustements.

A lire aussi  Bientôt tu parleras à ton frigo… et l’IA contrôlera tout : la prédiction terrifiante du patron de Reddit

Des mises massives au milieu des doutes

Pourtant, les géants tech doublent la mise : Alphabet, Amazon, Meta et Microsoft prévoient entre 635 et 665 milliards de dollars en 2026 pour booster l’IA. OpenAI vise même une valorisation à 850 milliards. Ces outils servent déjà au codage, à la rédaction de scénarios ou à l’aide décisionnelle, mais leur fragilité expose les créateurs à des plantages critiques.

Les geeks avisés savent désormais miser sur des requêtes courtes et ciblées. Reste à voir si les prochains modèles corrigeront ces travers pour vrai devenir des alliés fiables dans nos quêtes numériques quotidiennes.

Vous aimerez aussi

4 commentaires

  1. Ce chiffre de 25 points en moins de performance dès le 2e tour, ça m’a bluffé. Pas étonnant que parfois ça parte en vrille rapido !

  2. Le chiffre de 25 points de chute dès le deuxième tour m’a vraiment surpris, c’est énorme ! Je pensais pas que ça baissait aussi vite en pratique.

  3. Le chiffre de 25 points de chute après seulement deux tours, ça explique tellement pourquoi parfois je repars à zéro en discutant avec mon assistant…

  4. Le chiffre de 25 points de dégringolade dès le deuxième échange m’a blowé. Jamais pensé que ça baissait aussi vite en fiabilité sur les dialogues longs.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *