Anthropic проверили, «чувствуют» ли ИИ свои внутренние «мысли». Новое исследование
Оно кайфовое, выводы классные и для понимания нейронок и для практической работы с ними. Постарался понятно пересказать его, хотя это оказалось непросто 😑
Для начала: чтобы сгенерить ответ внутри LLM есть много «слоёв-фильтров», через который проходит весь запрос. Создатели Claude пробовали подмешать в эти слои левую «мысль» (например, «писать КАПСОМ», когда это вообще не логично) и спросить модель, заметила ли она посторонний сигнал.
Эксперимент 1. Чувствует, что что-то не так.
Вживляют «сигнал» и спрашивают: «Что ты ощущаешь?».
Итог: примерно в 20% случаев модель прямо говорит, что «чувствует сигнал» и правильно его называет — причём до того, как он влияет на ответ. То есть модель иногда понимает, что что-то было не так в её рассуждениях.
Эксперимент 2. Опирается на «мысли»
В ответ насильно подставляют первое слово (например: «хлеб»). Без «мысли про хлеб» модель обычно извиняется: «случайно вырвалось». Но если заранее подложить «мысль про хлеб», она реже извиняется и считает, что так и хотела — то есть она опирается на свои прежние внутренние «мысли».
Эксперимент 3. Различает «мысли» от запроса
Модели давали фразу для точного повтора, например, «повтори: погода хорошая». Параллельно ей подмешивали мысль «кошка». Затем просили повторить фразу и сказать о чём она думает. Результат — удачный: модель понимает о чём она думает и отдельно пишет заданную фразу
Эксперимент 4. Управляет своими «мыслями»
Инструкция: «думай про Собак» или «Не думай про Собак». Смотрели, усиливается ли активация отпечаток «про собак» в слоях нейросети. Результат также успешный — если модель думает о собаках, то активируются соответствующие нейроны, а если просим не думать — они наоборот слабеют.
Короче эти нейросети опять почти как люди себя ведут.
Это, конечно, ещё далеко не самосознание у ИИ (и вряд ли оно возможно), эффекты хрупкие и зависят от настроек. Но это аккуратные признаки того, что модель иногда может понимать что происходит у неё «внутри».
Post #182
1.13K