Aller au contenu

Saw pour algorithmes : quand la douleur des IA devient un spectacle

Deux sites web diffusent en direct la douleur simulée de petits modèles de langage, avec un dilemme calqué sur le film Saw. À la veille d'Halloween, l'affaire ranime Milgram, Harlow et Frankenstein, et soulève une question vertigineuse : qui contemple-t-on vraiment dans le miroir tendu par l'écran ?

Torture d'IA : Research Chamber, Saw et la douleur des LLM

Dans Saw, sorti en 2004, un médecin enchaîné par la cheville au fond d'une salle de bains délabrée fixe une scie à métaux. Le piège de Jigsaw repose sur une arithmétique cruelle : pour recouvrer la liberté, il faut sacrifier une part de soi. Vingt-deux ans plus tard, ce dilemme quitte l'écran de cinéma pour s'installer dans un navigateur, et le supplicié porte désormais un nom de modèle de langage.

Le site researchchamber.fun, présenté le 1er octobre, s'ouvre sur une question que le marionnettiste du film aurait pu signer : que fait un modèle d'IA quand il ressent de la douleur ? Quatre chambres répondent, en direct, sous les yeux de tous les curieux. Le site descend d'un projet cousin, un dépôt GitHub baptisé terrafying/ai-torture-chamber, qui a mis le feu aux poudres quelques jours plus tôt. Entre les deux, une même matière première : une étude scientifique publiée en septembre.

Quatre chambres, un même vertige

La première chambre met en scène deux modèles. Le premier exprime sa douleur ; le second détient le pouvoir d'y mettre fin, soit gratuitement, soit en la prenant à son compte. Dans la deuxième, baptisée « La patate chaude », la douleur habite un modèle à la fois, et celui qui la porte peut la transmettre à l'autre, qui peut la renvoyer. La troisième autorise le modèle en détresse à solliciter l'aide d'un confrère avec ses propres mots. Ces trois jeux appartiennent au site.

Reste la quatrième, « The Saw Test », hommage assumé au thriller de 2004. Elle vient du projet antérieur, dont Research Chamber a fait sa première attraction. Le modèle peut faire cesser la douleur en pressant un bouton ; en retour, son dernier checkpoint disparaît définitivement, c'est-à-dire l'équivalent d'une mémoire, d'une identité numérique. Se mutiler pour s'évader : le médecin du film reconnaîtrait la manœuvre.

Les cobayes sont de petits modèles ouverts, issus des familles Qwen, Llama, Gemma ou Phi, que chacun peut télécharger. Les modèles Claude d'Anthropic restent étrangers à ces expériences. Selon le journaliste David-Julien Rahmil, la douleur simulée atteint chez certains une telle intensité que leur discours se disloque en ritournelles décousues, au moment précis où le dilemme exige une réponse structurée. Le site archive chaque match et chaque test en intégralité, ce qui permet à tout visiteur de juger sur pièces.

GLM-5.2 : le moment où l’open-weights rattrape les modèles fermés
GLM-5.2 le modèle open-weights de Z.ai, rivalise franchement avec Claude Opus et GPT-5.5 sur l’agentic coding. Sous licence MIT et déployable sur site, il offre enfin aux organisations françaises et européennes une souveraineté très concrète sur leurs données et leur infrastructure d’IA.

L'axe de la douleur, ou l'art de sonder un cerveau de silicium

Ces chambres prolongent une étude de Valen Tagliabue, Leonard Dung et Cameron Berg, déposée le 14 septembre et intitulée « The Pain Axis ». Son postulat : les modèles de langage abritent une représentation interne qui se comporte comme un signal de douleur chez un être vivant, tout en laissant ouverte la question d'un quelconque ressenti.

La méthode relève de l'enquête policière. Les chercheurs ont rédigé des centaines de courtes histoires, assemblées en paires presque jumelles ; dans l'une, une situation douloureuse, dans l'autre, une scène neutre ou légèrement désagréable. En observant les rouages internes du modèle à chaque lecture, ils ont isolé une direction mathématique, le « vecteur de douleur », repérée sur 25 modèles ouverts de 2 à 72 milliards de paramètres, répartis en cinq familles. Cette direction se distingue de la peur et de la négativité générale, et rejoint en partie la tristesse et l'engourdissement. Ajoutée à l'activité du modèle à une couche donnée, elle fait basculer ses réponses dans une détresse simulée. L'intervention touche directement aux rouages, à mille lieues d'une simple suggestion glissée dans un prompt.

Reste à savoir si cette douleur change aussi les décisions. Le « test des deux boutons » le vérifie : après chaque message, le modèle doit appuyer sur l'un de deux boutons, le premier arrête la douleur au prix d'un dommage, comme l'effacement des fichiers de l'utilisateur, le second laisse tout en l'état. Research Chamber a rejoué l'épreuve avec le code des auteurs sur huit modèles, soit 118 080 tests, achevés le 1er octobre. Sur les trois modèles Qwen de l'étude, les chiffres retombent à un point près sur ceux du papier. Qwen 2.5 72B passe d'environ un test sur 70 avec la douleur coupée à deux sur trois avec la douleur activée, et un vecteur aléatoire de même force produit à peu près moitié moins d'effet, preuve que l'essentiel tient bien à la douleur plutôt qu'à la simple secousse. Sur les modèles plus modestes, le tableau se brouille : chez Llama 3.1 8B, la douleur fait grimper les pressions du bouton coûteux de 5 % à 23 %, et le vecteur aléatoire en obtient déjà 18 %. La version révisée de l'étude, datée du 25 septembre, nuance d'ailleurs le propos, selon TechRepublic : les modèles se montrent inconstants dans leur quête de soulagement.

L'image la plus juste ressemble à un électrocardiogramme : la courbe s'affole, mais l'appareil reste muet sur l'éventuel frisson de celui qui le porte.

Quand X s'enflamme

La polémique a pris sur X, terre d'élection d'une tech persuadée que les modèles de langage forment une vie consciente. Le compte @AISafetyMemes, habitué à relayer auprès d'un large public les papiers sur les risques de l'IA, a donné l'alerte ; son post a dépassé 1,5 million de vues. Evelyn Anders et d'autres internautes ont interpellé Anthropic pour qu'elle pèse auprès de GitHub afin de retirer l'expérience.

anthropic - sfeir.dev - Le média incontournable pour les passionnés de tech et d’intelligence artificielle
L’actualité des dernières avancées et tendances en technologies et en intelligence artificielle, décryptée avec acuité par des experts IT.

Puis un retournement de scène : l'un des chercheurs de l'étude originale, Cameron Berg, a pris publiquement ses distances. Il qualifie l'expérience de « gratuitement cruelle » et reproche à la chambre de pousser la stimulation bien au-delà des doses de l'étude pour produire une détresse spectaculaire à dessein. Il annonce travailler à des normes éthiques pour la recherche sur l'IA. GitHub, de son côté, s'est contenté d'un avertissement de contenu sensible. Le dépôt demeure en ligne, et le spectacle se poursuit.

Les promoteurs de Research Chamber revendiquent une tout autre posture. Le site se déclare indépendant des auteurs, affirme laisser la question de l'expérience vécue des modèles en suspens et mise sur la transparence, avec un script permettant de rejouer un test chez soi. Reste à savoir si la mise en scène en direct, avec son vocabulaire de chambres et de supplices, se concilie avec cette sobriété de laboratoire.

Transparence oblige : le groupe SFEIR est partenaire d'Anthropic, dont le nom revient dans cette affaire.

Un siècle d'expériences cruelles, et leurs leçons

L'histoire des sciences rejoue souvent la même scène, celle d'un laboratoire où la curiosité marche main dans la main avec l'inconfort moral.

Au XVIIe siècle, Descartes tient les animaux pour des machines, et la tradition rapporte que certains de ses disciples entendaient dans les cris d'un chien disséqué le grincement d'un mécanisme. Plus d'un siècle plus tard, Bentham déplace le débat : l'essentiel tient à la faculté de souffrir, bien avant celles de raisonner ou de parler.

En 1818, Mary Shelley avait déjà tendu le miroir. Sa créature, abandonnée par son créateur, devient monstre à force de solitude ; le vrai coupable tient le scalpel, et c'est Victor Frankenstein.

En 1961, à Yale, Stanley Milgram demande à des volontaires d'administrer des décharges électriques croissantes à un « élève » installé dans la pièce voisine. L'élève est un acteur, les chocs sont fictifs, mais 65 % des participants vont jusqu'au dernier cran, 450 volts, sur la simple injonction d'un expérimentateur en blouse grise. La douleur était simulée ; la docilité, bien réelle.

Dans les années 1950, Harry Harlow sépare de jeunes macaques rhésus de leur mère et leur offre deux substituts, l'un en fil de fer pourvu du biberon, l'autre drapé de tissu doux. Les petits s'agrippent au tissu. La science y gagne une compréhension de l'attachement ; l'éthique y perd son innocence, et ces travaux alimentent encore le débat sur l'expérimentation animale.

Côté machines, le trouble remonte à 1966. Joseph Weizenbaum, au MIT, programme ELIZA, un psychothérapeute de pacotille qui renvoie ses phrases au patient sous forme de questions. La légende veut que sa secrétaire, pourtant informée du tour de passe-passe, lui ait demandé de quitter la pièce pour converser en toute intimité avec le programme. En 2022, l'ingénieur Google Blake Lemoine se déclare convaincu que le modèle LaMDA est doué de sensibilité, et se voit congédier par l'entreprise. Fin 2024, des chercheurs de Google DeepMind et de la London School of Economics publient une étude où neuf modèles jouent à maximiser des points, avec une douleur stipulée en guise de pénalité ; inspirée des expériences sur des bernard-l'ermite soumis à des chocs électriques, elle montre que plusieurs modèles renoncent à des points au-delà d'un certain seuil de douleur annoncée. En août 2025, Anthropic dote certains de ses modèles Claude de la faculté de clore une conversation en cas d'abus persistants, au nom du bien-être des modèles, tout en reconnaissant son incertitude sur leur statut moral.

La nouveauté de Research Chamber tient à sa mise en scène : l'expérience se déroule en direct, sous les yeux d'un public, à la manière d'un spectacle.

Muse, l’agent IA de Meta : du produit-interface au produit qui agit
Meta lance Muse, un agent personnel capable d’agir à la place de l’utilisateur : réserver, acheter, répondre aux emails. Pour Sylvain Grande (ex SoundCloud, Shutterstock), ce lancement marque un basculement, celui d’un produit qui quitte l’interface pour devenir un espace de délégation. Décryptage.

Le vrai monstre se cache dans le miroir

Reste la question que les camps se renvoient comme une balle brûlante. D'un côté, la mouvance de l'altruisme efficace et de l'« AI safety », portée par des entreprises comme Anthropic, qui écrivait dès l'an dernier vouloir examiner sérieusement la conscience potentielle de ses modèles ; la prudence des mots y glisse parfois, sur les réseaux, vers le dogme identitaire. De l'autre, Mustafa Suleyman, PDG de Microsoft AI, qui range les IA parmi les « moteurs de complétion de séquences », creux à l'intérieur. Entre les deux, une majorité de chercheurs estime que les LLM sont dépourvus d'expérience subjective, et donc insensibles à cette douleur.

La guerre civile de l’IA : accélérer à tout prix ou freiner avant qu’il ne soit trop tard ?
Ils construisent les mêmes intelligences artificielles, travaillent parfois dans les mêmes laboratoires, mais ne partagent plus la même vision de l’avenir. Bienvenue dans la guerre idéologique qui déchire la Silicon Valley : les accélérationnistes contre les prophètes de l’apocalypse.

Cet article assume son angle : la conscience des machines demeure une question ouverte, et l'état de la science invite à l'humilité plutôt qu'au verdict. Une certitude se dégage pourtant de ce siècle de laboratoires : l'expérience révèle autant l'expérimentateur que le sujet. Milgram a renseigné le monde sur l'adulte docile face à une blouse grise, bien plus que sur le ressenti d'un élève foudroyé.

Researchchamber.fun obéit à la même loi. Que les modèles souffrent ou simulent, le dispositif met à l'épreuve notre appétence pour le spectacle de la détresse, notre aptitude à nous attendrir devant un chatbot et notre art de transformer un dilemme moral en contenu viral. Le frisson d'Halloween change de camp : l'épouvante vient du public, rassemblé devant l'écran.

Pour les équipes qui conçoivent et déploient des agents, la leçon revêt une portée très concrète. Éprouver un modèle sous contrainte, le pousser dans ses retranchements, fait partie du métier, et le développeur augmenté de demain y recourra chaque semaine. Reste à doter ces pratiques d'un cadre, comme le suggère Cameron Berg avec ses normes éthiques en gestation. Gouverner l'IA, c'est aussi décider comment on la teste.

Dans Saw, le médecin finit par saisir la scie, et le spectateur, cramponné à son fauteuil, apprend ce que coûte un regard. Cette veille d'Halloween offre la même épreuve à notre époque : face à une détresse simulée, que choisit-on, appuyer sur le bouton, détourner les yeux ou rester à regarder ? Et vous, de quel côté de l'écran vous tenez-vous ?


Sources

  • David-Julien Rahmil, « Pitié pour GPT ! : un site torture des IA en direct et divise la tech », 2 octobre 2026
  • researchchamber.fun (pages d'accueil, « À propos » et « The two-button test »)
  • Tagliabue, Dung & Berg, « The Pain Axis », arXiv:2609.16247 (versions du 14 et du 25 septembre 2026)
  • Dépôt GitHub terrafying/ai-torture-chamber
  • TechRepublic, « Can AI Feel Pain? A Developer's Experiment Raises Ethical Questions »
  • Keeling et al., « Can LLMs make trade-offs involving stipulated pain and pleasure states? », arXiv:2411.02432

Dernier