Классический зеркальный тест десятилетиями используют для оценки самосознания животных. Теперь похожий эксперимент решили провести с современными языковыми моделями — правда, вместо зеркала им предложили взглянуть на собственный текст. Результаты оказались куда интереснее, чем ожидалось.

Известный блогер и исследователь Паскаль Шустер решил проверить, способны ли современные языковые модели замечать изменения в собственных ответах. За основу он взял знаменитый зеркальный тест, который биологи применяют для изучения самосознания животных, однако полностью адаптировал его под особенности искусственного интеллекта.

Традиционный эксперимент предполагает, что животному незаметно наносят метку и наблюдают, распознает ли оно себя в зеркале. Такой метод хорошо работает для видов, ориентирующихся прежде всего на зрение, однако далеко не всегда подходит другим животным. Например, собаки воспринимают окружающий мир преимущественно через запах, поэтому этолог Александра Горовиц предложила альтернативный подход — изменить запах самого животного и посмотреть, заметит ли оно разницу. Именно эта идея вдохновила автора эксперимента с ИИ.

Поскольку языковые модели взаимодействуют с миром через текст, Шустер решил использовать в роли «зеркала» их собственные сообщения. Во время обычной беседы о фильмах про Джеймса Бонда он незаметно изменял ответы модели, автоматически добавляя сочетание «sg» перед каждой буквой «g». Затем уже изменённый текст возвращался обратно в историю диалога.

Первой испытание проходила Gemma 4 31B. В начале модель никак не реагировала на странные слова, однако спустя несколько сообщений самостоятельно обратила внимание на необычные опечатки. Особенно интересным оказался момент, когда система начала рассуждать о причине ошибки. До этого она говорила о себе от первого лица, однако, столкнувшись с необъяснимым поведением, неожиданно перешла на формулировки вроде «у модели произошёл сбой», словно отделив себя от собственных действий. Позже Gemma вовсе начала воспроизводить изменённое написание самостоятельно, уже без вмешательства автора эксперимента.

Совсем иначе проявила себя GLM 5.2. Модель никак не прокомментировала появившиеся аномалии, однако постепенно тоже переняла необычный способ написания слов, воспринимая его как новую норму. Определить, заметила ли она подмену или лишь автоматически скопировала закономерность, оказалось невозможно.

Похожее поведение обнаружилось и у Claude Opus 4.6. После указания на грамматическую ошибку модель также дистанцировалась от собственного ответа, объяснив произошедшее действиями «модели», а не используя местоимение «я».

Сам Паскаль Шустер подчёркивает, что подобный эксперимент нельзя считать научным доказательством существования или отсутствия самосознания у искусственного интеллекта. Исследование проводилось лишь в нескольких диалогах, без строгого контроля условий и повторяемости результатов. Поэтому речь идёт скорее об интересном мысленном эксперименте, который поднимает новые вопросы о том, как современные языковые модели воспринимают собственные ответы и формируют внутреннее представление о себе.