TGViewer
Канал Никиты из IT Канал Никиты из IT @niar42 · 2.43K subscribers
Post #182 1.13K
Anthropic проверили, «чувствуют» ли ИИ свои внутренние «мысли». Новое исследование

Оно кайфовое, выводы классные и для понимания нейронок и для практической работы с ними. Постарался понятно пересказать его, хотя это оказалось непросто 😑

Для начала: чтобы сгенерить ответ внутри LLM есть много «слоёв-фильтров», через который проходит весь запрос. Создатели Claude пробовали подмешать в эти слои левую «мысль» (например, «писать КАПСОМ», когда это вообще не логично) и спросить модель, заметила ли она посторонний сигнал.

Эксперимент 1. Чувствует, что что-то не так.
Вживляют «сигнал» и спрашивают: «Что ты ощущаешь?».
Итог: примерно в 20% случаев модель прямо говорит, что «чувствует сигнал» и правильно его называет — причём до того, как он влияет на ответ. То есть модель иногда понимает, что что-то было не так в её рассуждениях.

Эксперимент 2. Опирается на «мысли»
В ответ насильно подставляют первое слово (например: «хлеб»). Без «мысли про хлеб» модель обычно извиняется: «случайно вырвалось». Но если заранее подложить «мысль про хлеб», она реже извиняется и считает, что так и хотела — то есть она опирается на свои прежние внутренние «мысли».

Эксперимент 3. Различает «мысли» от запроса
Модели давали фразу для точного повтора, например, «повтори: погода хорошая». Параллельно ей подмешивали мысль «кошка». Затем просили повторить фразу и сказать о чём она думает. Результат — удачный: модель понимает о чём она думает и отдельно пишет заданную фразу

Эксперимент 4. Управляет своими «мыслями»
Инструкция: «думай про Собак» или «Не думай про Собак». Смотрели, усиливается ли активация отпечаток «про собак» в слоях нейросети. Результат также успешный — если модель думает о собаках, то активируются соответствующие нейроны, а если просим не думать — они наоборот слабеют.

Короче эти нейросети опять почти как люди себя ведут.
Это, конечно, ещё далеко не самосознание у ИИ (и вряд ли оно возможно), эффекты хрупкие и зависят от настроек. Но это аккуратные признаки того, что модель иногда может понимать что происходит у неё «внутри».
Anthropic Signs of introspection in large language models Research on the ability of large language models to introspect on their own internal states.
  • 🔥 21
  • 😐 6
More from @niar42
  1. Sep 17, 2026Я не живу в России по политическим причинам с 2023 года. И я продолжаю работать с российск…
  2. Sep 16, 2026Ребят, вам вот так могут писать скамеры упоминая мой канал. Мне пара человек написало об э…
  3. Sep 16, 2026За две недели в ИИ навалили дофига всего Gemini апнули флешку до 3.8. Вообще хорошая модел…
  4. Sep 13, 2026Обещал позвать вас пообщаться — зову =) На скрине немного того, что мы сейчас пилим. Назыв…
  5. Sep 5, 2026Где-то полтора года назад мы собирались запускать своё обучение по автоматизации нейросетя…
  6. Sep 4, 2026Своровал отсюда Астра играет на пианино в прямом эфире. Это про то, насколько быстро она у…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →