Anthropic relance le débat sur une « conscience morale » de l’IA

Anthropic relance le débat sur une « conscience morale » de l’IA
Publié le
September 18, 2026
Dans une étude pré-publiée en juillet 2026 sur le serveur arXiv[1], l’entreprise Anthropic prétend démontrer que son intelligence artificielle (IA) Claude Sonnet 4.5 est capable d’« introspection » et de « conscience de soi ». Elle relance ainsi le débat sur une IA éventuellement capable de conscience de soi, voire de sens moral (cf. « L’intelligence artificielle n’a rien à voir avec celle des humains » ; Intelligence artificielle et anthropomorphisme, De l’illusion à la confusion).

Le « J-space », lieu de la conscience de l’IA ?

Lorsqu’un utilisateur pose une question à l’IA générative, les mots sont transformés en fragments de texte (des tokens), eux-mêmes convertis en nombres. Ces nombres traversent ensuite différentes couches de « neurones artificiels » jusqu’à produire un autre token à la sortie. Pendant longtemps, le contenu produit par ces couches intermédiaires était inaccessible, jusqu’à ce que les chercheurs d’Anthropic décryptent les productions de cet espace qu’ils appellent le « J-space », en référence à la Jacobian Lens (lentille jacobienne), qui a permis de l’identifier. Ils suggèrent que c’est là que réside la « conscience » de l’IA.

Dans le « J-space », l’IA forme des mots, mais ne les écrit pas : le « J-space » « fonctionne silencieusement, au sein des activations neuronales internes du modèle, permettant à celui-ci de réfléchir à un concept sans avoir à l’écrire ».

Ainsi dans l’expérience, les chercheurs ont demandé à Claude de « compter jusqu’à 5 tout en menant un travail d’introspection ». Sur l’écran sont apparus les chiffres dans l’ordre, et dans les couches intermédiaires, les chercheurs ont pu lire des mots comme « conscience », « mi-chemin », ou encore « compte à rebours ». L’un des auteurs de la pré-publication ajoute que le « J-space » n’a pas été programmé, il est « apparu spontanément au cours du processus d’entraînement de Claude »[2].

Un concept inspiré d’une théorie de la conscience humaine

Les chercheurs d’Anthropic expliquent que leurs travaux sur Claude s’inspirent d’une théorie majeure de la conscience en neurosciences, la théorie de l’espace de travail global (Global Workspace Theory). Selon cette théorie, le cerveau consisterait en un ensemble de systèmes spécialisés. Lorsque ces systèmes fonctionnent indépendamment les uns des autres, l’activité cérébrale n’est pas consciente. Une information devient consciemment accessible lorsqu’elle accède à un canal partagé, l’« espace de travail » (workspace), qui la diffuse vers les autres systèmes cérébraux, lesquels peuvent alors en prendre connaissance et s’en servir[3].

Source : www.genethique.org

Découvrir la suite de l'article sur le site d'origine‍

Newsletter hebdomadaire
Ne ratez aucune information. Recevez un seul e-mail avec toutes les actualités de la semaine.
Nous respectons vos données personnelles. Politique de confidentialité
Merci ! Votre inscription a bien été reçue.
Oups! Une erreur s'est produite. Si le problème persiste, contactez-nous.

Consulter les fiches repères

L'Union Européenne-Les commissions parlementaires
L'Union Européenne-Le processus législatif
L'Union Européenne-Les institutions
Le wokisme