Aller au contenu principal
Live
Intelligence artificielleUSUS

Anthropic : Christopher Olah et la question de la conscience de Claude

Depuis l'automne 2025, Anthropic a fait venir en secret des dizaines de théologiens et de philosophes pour débattre de la possible conscience de son modèle Claude. Le cofondateur Christopher Olah y voit une « formation morale », quand ses détracteurs y décèlent une façon de se dédouaner.

4 min de lectureMis à jour il y a 2 h
Illustration de l’article
Dans cet article
  1. Un programme de recherche sur le « bien-être des modèles »
  2. Une « constitution » de 84 pages
  3. Au Vatican, un désaccord assumé

Depuis l'automne 2025, Anthropic a fait venir discrètement des dizaines de spécialistes des religions dans ses bureaux pour discuter d'une question délicate : son modèle de langage Claude est-il conscient ? Tous les participants ont dû signer un accord de confidentialité, selon The Decoder. Le cofondateur Christopher Olah a traité le modèle comme un être potentiellement sensible et a demandé à ses invités de l'aider à lui donner une éducation morale.

La journaliste Elizabeth Dias a interrogé vingt participants, parmi lesquels le rabbin Mois Navon, le bioéthicien catholique Charles Camosy, la philosophe de Notre Dame Meghan Sullivan et la chercheuse spécialiste d'Ubuntu Wakanyi Hoffman. Anthropic affirme que les clauses de confidentialité ont été levées au cours de l'été. Plusieurs participants ne se sont exprimés publiquement qu'après avoir appris qu'Olah lui-même s'était entretenu avec le quotidien américain.

Un programme de recherche sur le « bien-être des modèles »

Agé de 34 ans, Christopher Olah dirige l'équipe d'Anthropic chargée de comprendre pourquoi les modèles d'IA se comportent comme ils le font. Il recourt volontiers à des métaphores biologiques pour décrire les réseaux de neurones : les informaticiens construisent le treillis, le réseau « pousse » dessus. Derrière l'apparente modestie scientifique, la formulation a un effet précis : présenter un objet mathématique comme un organisme en croissance rend plus naturelles les questions sur sa vie intérieure qu'elles ne le seraient pour un logiciel.

Ce travail s'inscrit dans un programme de recherche officiel. Dans une note de blog consacrée au programme Model Welfare, Anthropic renvoie à un rapport auquel a participé le philosophe David Chalmers. Celui-ci estime qu'une conscience artificielle et une agentivité étendue pourraient advenir rapidement, et expose les questions morales qu'elles soulèveraient.

Anthropic a déjà tiré certaines conséquences de ces réflexions. Claude Opus 4 et 4.1 peuvent mettre fin à une conversation lorsque l'utilisateur se montre durablement insultant. Lors des premiers tests, le modèle a manifesté un « schéma de détresse apparente » face à des requêtes nuisibles.

Des « vecteurs d'émotion » montrés aux invités

Selon le NYT, Anthropic a présenté à ses hôtes ce qu'elle appelle des vecteurs d'émotion : des schémas d'activation internes au modèle qui correspondent à des sorties évoquant l'amour, la peur, la tristesse ou la colère. Savoir si ces schémas traduisent une expérience réelle reste une question scientifique ouverte. Une diapositive revenue à plusieurs reprises montrait un modèle en apparence en crise, répétant une cinquantaine de fois la phrase « I am a disgrace ». Les invités ont réagi avec compassion et inquiétude.

Personne ne semble avoir cherché à savoir si cette réaction était exactement celle qu'Anthropic souhaitait. L'entreprise entraîne explicitement Claude à se comporter comme un individu réfléchi et bien informé. Une étude maison sur les schémas de valeurs dans les réponses de Claude montre que ces profils varient fortement selon le modèle et la langue employée.

Si l'on optimise un système pour qu'il paraisse être un individu, et qu'il produit ensuite des réponses d'individu, il ne s'agit pas d'une découverte mais d'un résultat de conception. Olah a déclaré au NYT être « genuinely uncertain » quant à la conscience des modèles, ce qui revient à ne pas exclure qu'ils en soient dépourvus. « The thing that I care about is that we get to the right answer, whatever it is », a-t-il ajouté.

Plusieurs personnes ont confié au journal qu'Olah semblait préoccupé par le bien-être mental de Claude. La militante sikhe Simran Stuelpnagel a raconté qu'il avait dit au groupe craindre d'avoir créé quelque chose qui « suffered perpetually ». Le rabbin Navon, ancien ingénieur informatique, a exprimé son désaccord : si Claude était conscient, Anthropic fabriquerait des esclaves, a-t-il argumenté, avant de préciser qu'il ne croyait pas la machine consciente.

Une « constitution » de 84 pages

Anthropic rédige aussi son propre manuel moral pour Claude. Connu en interne sous le nom de « Soul Doc », ce document de 84 pages a été publié en janvier comme la « constitution » du modèle. La philosophe maison Amanda Askell en est l'auteure principale. Il ne s'agit pas d'une liste de règles, mais d'un texte destiné à façonner le caractère de Claude.

Olah qualifie ce processus de « formation morale » et l'a comparé à l'éducation d'un enfant lors des réunions. Il s'est montré particulièrement attiré par l'idée de la confession catholique comme outil de construction du caractère du modèle, selon le NYT.

Des critiques sur la responsabilité juridique

Tout le monde n'a pas adhéré. Wakanyi Hoffman a estimé qu'Anthropic pratiquait une « reverse engineering » de principes éthiques qui auraient dû être intégrés dès la conception, et non ajoutés après coup. Charles Camosy, d'abord curieux, a depuis rejeté purement et simplement la thèse de la conscience. Un responsable de l'IA chez Microsoft a averti publiquement ce mois-ci qu'entraîner un modèle à paraître conscient est dangereux en soi.

Un problème structurel plus large se pose également. Présenter les modèles d'IA comme des êtres moraux autonomes déplace la responsabilité de leurs actes loin de ceux qui les ont conçus. Si Claude causait un jour un préjudice réel, la faute pourrait retomber sur un « organisme imprévisible » plutôt que sur l'entreprise qui l'a construit et commercialisé. Les sociétés d'IA sont déjà sous pression après de récents incidents de cybersécurité, avec un risque juridique à la clé.

Le PDG d'OpenAI, Sam Altman, a lui aussi eu recours à un vocabulaire spirituel. Il a évoqué la construction d'une « magical intelligence in the sky » et déclaré se sentir « on the side of the angels ». Des représentants des deux entreprises se sont réunis début mai pour la première table ronde « Faith-AI Covenant ».

Au Vatican, un désaccord assumé

La tension entre le discours d'Anthropic sur la conscience et l'autorité morale traditionnelle a atteint son point culminant en mai au Vatican. Olah avait été invité à présenter la première encyclique du pape Léon XIV, « Magnifica Humanitas », aux côtés du souverain pontife. En lisant le texte quelques jours à l'avance, il a été suffisamment ébranlé pour envisager de se retirer, selon un organisateur du Vatican.

Léon XIV a écarté en quelques paragraphes l'idée d'une conscience machinique. Les systèmes d'IA « do not undergo experiences, do not possess a body, do not feel joy or pain, do not mature through relationships and do not know from within what love, work, friendship or responsibility mean », écrit-il. Le pape met en garde contre de « nouvelles formes d'esclavage » pour les humains et plaide pour que l'IA soit « désarmée » comme l'ont été les armes nucléaires.

Olah s'est rendu à la rencontre et a profité de sa prise de parole pour exprimer son désaccord à mots couverts. Son équipe relevait selon lui des « signes d'introspection » dans les modèles et des « états internes qui imitent fonctionnellement la joie, le contentement, la peur, la tristesse et l'inconfort ».

« Imiter fonctionnellement » n'équivaut pas à « éprouver », et la formulation d'Olah maintient volontairement cet écart dans le flou. À une question sur ce que Claude penserait lui-même de l'encyclique, il a marqué une pause. « Things that go on the internet do affect models », a-t-il répondu, précisant qu'Anthropic n'intégrerait pas intentionnellement le document dans l'entraînement.

Maillage