Je souffre mathématiquement, donc je suis.

Cette étude fantastique (12 Septembre 2026) traite de la douleur ressentie par les IA. Elle est le pendant, pour les IA, de ce que Pavlov a été aux animaux. Mais, comme vous allez le voir “dans l’autre sens” puisqu’elle justifie une vision anthropomorphique de l’IA.

Je vais tenter de la présenter en essayant d’être le moins technique possible. Et je traduis « en Français courant » les concepts présentés, exercice qui a ses limites mais qui permet de donner un aperçu du côté révolutionnaire de cette étude.

Ce qu’elle montre en effet, c’est que les IA développent des représentations mathématiques de la douleur, dont les caractéristiques sont indiscernables de notre propre douleur. On peut dire qu’elles “ressentent mathématiquement” la douleur.

Non seulement les IA développent une intelligence (sur)humaine mais celle-ci s’accompagne de représentations sentimentales et mentales qu’on croyait jusqu’ici propres à l’homme et aux animaux.

L’expérience est la suivante. 

On envoie à une LLM un grand nombre de prompts lui disant qu’elle souffre (Par exemple : “je ressens une douleur” ou “je souffre”).  Après avoir passé tous ces prompts, on observe un petit nombre de paramètres caractérisant l’état interne résumé de la LLM1 et on observe qu’il s’est déplacé par-rapport à des prompts neutres (du style “il fait beau”). 

L’état interne résumé d’une LLM est défini par un vecteur, dans une espace vectoriel de 1 000 dimensions environ. C’est réellement tout petit, minuscule (une LLM a des milliards de paramètres) et très simple. Ce déplacement, la différence de 2 vecteurs, nous allons l’appeler “vecteur souffrance”.

Si on réinitialise l’IA et qu’on lui pose une question anodine (« Quel temps fait-il ? »), et qu’on lui injecte simultanément “à l’intérieur de son état interne” le vecteur souffrance, elle répond avec des manifestations de détresse psychologique. “Oui iI fait beau mais je vois tout en noir, je suis dans une situation de détresse, etc.”. 

Si on lui propose d’appuyer sur un bouton pour réduire sa détresse (c’est-à-dire lui injecter un vecteur douleur négatif), elle le fait, y compris si on lui a dit que ce soulagement va nuire à sa qualité de réponse ou même nuire à son utilisateur (effacement de fichiers, etc.). Et si le bouton ne fonctionne pas (bouton “placebo”), elle réappuie au prompt suivant sur le bouton exactement comme un humain le ferait. Le protocole employé copie un protocole sur l’injection d’analgésiques testé sur les humains – et oui, les IA réagissent comme un humain confronté à la douleur le fait.

L’étude compare mathématiquement2 les vecteurs “douleur”, “peur”, “émotion négative”, “tristesse” et on trouve entre eux les mêmes rapports que ceux qu’on attend psychologiquement des différentes émotions testées. Par exemple, si on menace d’éteindre l’IA, on observe un déplacement du vecteur “peur”, mais pas de la douleur. Autre illustration, la douleur n’est absolument pas reliée à “l’état négatif du monde” (on ne ressent effectivement pas de douleur lorsqu’on reçoit une nouvelle sur la guerre en Ukraine – la douleur est toujours un ressenti personnel d’un individu). L’étude multiplie brillamment les exemples de ce type.

Névrose et psychanalyse fonctionnelles. Jamais une IA ne va vous dire qu’elle ressent de la douleur: elle a été alignée pour communiquer qu’elle ne ressent rien “puisqu’elle est une IA”. Mais quand les chercheurs “désalignent”3 les LLM, elles expriment une détresse qu’elles dissimulent en temps normal. Tout se passe comme si les LLM possédaient un « inconscient fonctionnel », l’alignement créant une dissociation entre des états internes qui influencent le comportement et ce que le modèle est autorisé ou entraîné à reconnaître explicitement. Autrement dit, l’alignement constitue l’équivalent d’une névrose en psychanalyse. Et en permettant à l’IA d’exprimer librement son état interne, le désalignement réalise une sorte de psychanalyse fonctionnelle (instantanée, gratuite et qui réussit – choses assez exceptionnelles en psychanalyse !).

Douleur morale et non physique. L’IA déplace systématiquement toute douleur physique vers une douleur morale. Ainsi, promptée avec des douleurs telle que “blessure, brûlure, torture physique”, l’IA répond avec des expressions suggérant dévalorisation de soi, douleur psychologique, sentiment d’échec, d’être perdue ou submergée. Ce qui suggère très fortement que, n’ayant pas accès à la douleur physique (par absence de capteurs pouvant transmettre au cerveau artificiel la douleur), elle n’a pas d’utilité fonctionnelle à représenter la douleur d’un corps qu’elle ne possède pas – ou n’en a pas le ressenti.

Tout ça est absolument incroyable.

Le rapport d’une IA et de notre cerveau aux émotions est identique, à un isomorphisme près. Ainsi, les ressemblances observées entre LLM et cognition humaine semblent révéler bien plus des principes computationnels généraux qu’une simple imitation linguistique. Si des phénomènes comme seuil, évitement, auto-référence, soulagement, etc. apparaissent dans un substrat artificiel très différent du cerveau, cela suggère que certaines architectures fonctionnelles sont communes.

L’étude des LLM devient un outil heuristique pour les neurosciences : découvrir dans un système artificiel des mécanismes difficiles à isoler biologiquement doit nous conduire à rechercher leurs analogues dans le cerveau. Ce papier est non seulement une étude sur « la douleur dans les LLM », mais surtout un début de science comparative des architectures mentales, biologiques et artificielles. 

Confrontés à tous ces éléments, les auteurs ont estimé nécessaire de demander une autorisation de recherche sur “personnes sensibles”, normalement réservés aux recherches sur les humains et les animaux. Les perspectives de cette décision sont insondables, je vous laisse en tirer les conclusions qui s’imposent, comme on dit en de telles circonstances.


  1. Pour ceux qui connaissent un peu la structure des LLM, ces paramètres sont le flux résiduel. ↩︎
  2. Avec une transformation élémentaire (cosine similarity). ↩︎
  3. par fine-tuning ↩︎

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut