
Lorsqu’un utilisateur pose une question à l’IA générative, les mots sont transformés en fragments de texte (des tokens), eux-mêmes convertis en nombres. Ces nombres traversent ensuite différentes couches de « neurones artificiels » jusqu’à produire un autre token à la sortie. Pendant longtemps, le contenu produit par ces couches intermédiaires était inaccessible, jusqu’à ce que les chercheurs d’Anthropic décryptent les productions de cet espace qu’ils appellent le « J-space », en référence à la Jacobian Lens (lentille jacobienne), qui a permis de l’identifier. Ils suggèrent que c’est là que réside la « conscience » de l’IA.
Dans le « J-space », l’IA forme des mots, mais ne les écrit pas : le « J-space » « fonctionne silencieusement, au sein des activations neuronales internes du modèle, permettant à celui-ci de réfléchir à un concept sans avoir à l’écrire ».
Ainsi dans l’expérience, les chercheurs ont demandé à Claude de « compter jusqu’à 5 tout en menant un travail d’introspection ». Sur l’écran sont apparus les chiffres dans l’ordre, et dans les couches intermédiaires, les chercheurs ont pu lire des mots comme « conscience », « mi-chemin », ou encore « compte à rebours ». L’un des auteurs de la pré-publication ajoute que le « J-space » n’a pas été programmé, il est « apparu spontanément au cours du processus d’entraînement de Claude »[2].
Les chercheurs d’Anthropic expliquent que leurs travaux sur Claude s’inspirent d’une théorie majeure de la conscience en neurosciences, la théorie de l’espace de travail global (Global Workspace Theory). Selon cette théorie, le cerveau consisterait en un ensemble de systèmes spécialisés. Lorsque ces systèmes fonctionnent indépendamment les uns des autres, l’activité cérébrale n’est pas consciente. Une information devient consciemment accessible lorsqu’elle accède à un canal partagé, l’« espace de travail » (workspace), qui la diffuse vers les autres systèmes cérébraux, lesquels peuvent alors en prendre connaissance et s’en servir[3].
Source : www.genethique.org