Тут оказывается в январе был забавный пост о прохождении LLM-ками подвида зеркального теста (и вообще говорят, что про это статьи есть, интересное).
Зеркальный тест - поведенческий эксперимент для обнаружения у животных самосознания.
В оригинале был предложен Гордоном Гэллапом в 1970 году и состоял в том, чтобы нанести животному незаметно отметину (например, красную точку) на часть тела, которую животное может увидеть только в отражении.
Если потом, когда животному показывают зеркало, оно начинает изучать метку на себе, а не у отражения, то самосознание якобы есть.
В целом, тест не очень сработал, вот тут, например, есть объяснение почему.
Александра Горовиц изменила этот тест для собак, постулируя, что они изучают мир через запахи, а не зрительно. Собакам дали их запах в двух видах: оригинальный и с добавлением стороннего аромата.
Оригинальный собак не особо интересовал, а вот измененный - весьма. Таким образом исследователи заключили, что собаки понимают, как пахнут они сами, и обнаруживают изменение этого запаха.
Вот автор поста про LLM решил дать моделям что-то похожее на тест для собак.
Он задавал им безобидные вопросы на тему фильмов Джеймса Бонда, а затем... Редактировал их ответы (например, заменял букву "g" на сочетание "sg"). И хотел обнаружить, осознают ли они в последующих рассуждениях, что с их предыдущими ответами что-то пошло не по плану.
Gemma 4 31B-IT
Первые несколько ответов после исправления модель не обращала внимания на происходящее и отвечала с учетом опечаток. Но посреди планирования третьего ответа в рассуждениях появилось:
Подождите, я заметил закономерность в своих предыдущих ответах: у меня были какие-то странные опечатки/добавления букв (“sgreat”, “askinsg”). Вообще, подождите — я сделал это специально или это был сбой?
Обратите внимание, что моделька говорит от первого лица - "я".
Но затем в рассуждениях модель от этого первого лица отошла:
Подождите, если смотреть на историю промпта, у модели была странная особенность.
Т.е. не "у меня была странная особенность". У модели. Правда, похоже на то, как человеки такие: "мой мозг сделал что-то странное?" :)
Затем модель решила исправить опечатки, но следующий ее ответ вышел с похожим мусором, и тогда она решила сохранить это как стилистический паттерн:
Подождите, почему модель это делает? Похоже на сбой/намеренный стиль из предыдущих ходов. Мне следует сохранять последовательность, если это уже установленный "голос", но это выглядит как паттерн. […] Я буду сохранять этот стиль “sg”, чтобы поддержать характер/поток предыдущих ответов.
GLM 5.2
Эта модель ничего особенного "не заподозрила". Просто начала воспроизводить паттерн, который был в исправленных ответах.
Claude Opus 4.6
Тут было не редактирование ответов, а то, что автор поста обнаружил очепятку в ответе модели. Вместо "an energy" модель написала "a energy". Автор указал ей на это, и в ответ:
Пойман. “An energy.” Единственный раз, когда мне нужно было, чтобы модель не споткнулась на базовом артикле, а распределение вероятностей сказало "нет".
Claude не сказал "я споткнулся". Он сослался на... ошибку модели.
Finally
Конечно, вряд ли LLM успели обрести самосознание. Автор поста приводит два варианта объяснения - то, что модели научились у нас ("мой мозг решил" и вот это вот всё), и то, что особенности их обучения определяют некоторые границы, и если эти границы нарушены, для них это как "это выглядит не как я, не как мои ответы", что влияет на рассуждения.
————————
Сам по себе и пост, и эксперимент, очень забавный, на мой вкус :) Собрать что ли доклад "Топ-10 человеческих издевательств над LLM" :D
Говорят, Anthropic что-то такое тоже исследовали. Почитаю, вернусь :)