TGViewer
Аналитик на коне Аналитик на коне @equestrian_analyst · 179 subscribers
Post #137 235
ИИ и... самосознание?

Тут оказывается в январе был забавный пост о прохождении LLM-ками подвида зеркального теста (и вообще говорят, что про это статьи есть, интересное).

Зеркальный тест - поведенческий эксперимент для обнаружения у животных самосознания.

В оригинале был предложен Гордоном Гэллапом в 1970 году и состоял в том, чтобы нанести животному незаметно отметину (например, красную точку) на часть тела, которую животное может увидеть только в отражении.

Если потом, когда животному показывают зеркало, оно начинает изучать метку на себе, а не у отражения, то самосознание якобы есть.

В целом, тест не очень сработал, вот тут, например, есть объяснение почему.

Александра Горовиц изменила этот тест для собак, постулируя, что они изучают мир через запахи, а не зрительно. Собакам дали их запах в двух видах: оригинальный и с добавлением стороннего аромата.

Оригинальный собак не особо интересовал, а вот измененный - весьма. Таким образом исследователи заключили, что собаки понимают, как пахнут они сами, и обнаруживают изменение этого запаха.

Вот автор поста про LLM решил дать моделям что-то похожее на тест для собак.

Он задавал им безобидные вопросы на тему фильмов Джеймса Бонда, а затем... Редактировал их ответы (например, заменял букву "g" на сочетание "sg"). И хотел обнаружить, осознают ли они в последующих рассуждениях, что с их предыдущими ответами что-то пошло не по плану.

Gemma 4 31B-IT
Первые несколько ответов после исправления модель не обращала внимания на происходящее и отвечала с учетом опечаток. Но посреди планирования третьего ответа в рассуждениях появилось:

Подождите, я заметил закономерность в своих предыдущих ответах: у меня были какие-то странные опечатки/добавления букв (“sgreat”, “askinsg”). Вообще, подождите — я сделал это специально или это был сбой?

Обратите внимание, что моделька говорит от первого лица - "я".

Но затем в рассуждениях модель от этого первого лица отошла:

Подождите, если смотреть на историю промпта, у модели была странная особенность.

Т.е. не "у меня была странная особенность". У модели. Правда, похоже на то, как человеки такие: "мой мозг сделал что-то странное?" :)

Затем модель решила исправить опечатки, но следующий ее ответ вышел с похожим мусором, и тогда она решила сохранить это как стилистический паттерн:

Подождите, почему модель это делает? Похоже на сбой/намеренный стиль из предыдущих ходов. Мне следует сохранять последовательность, если это уже установленный "голос", но это выглядит как паттерн. […] Я буду сохранять этот стиль “sg”, чтобы поддержать характер/поток предыдущих ответов.

GLM 5.2

Эта модель ничего особенного "не заподозрила". Просто начала воспроизводить паттерн, который был в исправленных ответах.

Claude Opus 4.6

Тут было не редактирование ответов, а то, что автор поста обнаружил очепятку в ответе модели. Вместо "an energy" модель написала "a energy". Автор указал ей на это, и в ответ:

Пойман. “An energy.” Единственный раз, когда мне нужно было, чтобы модель не споткнулась на базовом артикле, а распределение вероятностей сказало "нет".

Claude не сказал "я споткнулся". Он сослался на... ошибку модели.

Finally

Конечно, вряд ли LLM успели обрести самосознание. Автор поста приводит два варианта объяснения - то, что модели научились у нас ("мой мозг решил" и вот это вот всё), и то, что особенности их обучения определяют некоторые границы, и если эти границы нарушены, для них это как "это выглядит не как я, не как мои ответы", что влияет на рассуждения.

————————

Сам по себе и пост, и эксперимент, очень забавный, на мой вкус :) Собрать что ли доклад "Топ-10 человеческих издевательств над LLM" :D

Говорят, Anthropic что-то такое тоже исследовали. Почитаю, вернусь :)
  • ❤ 4
  • 😁 3
  • 🤔 1
  • 👀 1
More from @equestrian_analyst
  1. Aug 18, 2026День почти закончился, но грех не запостить про... день рождения 🦄 Да, сегодня мне стукну…
  2. Aug 14, 2026Новая книга по C4: финальное summary, часть 2 Продолжение вчерашнего поста про новую книгу…
  3. Aug 13, 2026Новая книга по C4: финальное summary, часть 1 Дочитала новую книгу Брауна. Что могу сказат…
  4. Aug 5, 2026ИИ-агенты и автономность: кейс AISI с атакой на реальные проекты Я профукала момент, чтобы…
  5. Jul 14, 2026Post #141
  6. Jul 8, 2026И немного про ближайшее будущее Что я предполагаю тут постить в ближайшее время: ▶️Ожидает…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →