(1/4) мой разбор новой работы anthropic про внутренние мысли модели ( j-space) от 6 июля и реакции moonshots
в moonshots ее пересказывают и делают выводы почти как:
- claude conscious
- мы нашли его скрытые мысли
- теперь сможем замечать ложь
- alignment становится решаемым
(тут саммари подкаста)
я очень люблю позитивных муншот чуваков, и при этом мне кажется, работа говорит почти
РОВНО ПРОТИВОПОЛОЖНОЕ
сейчас объясню
—
сначала настоящий вау
anthropic нашли внутри claude структуру, удивительно похожую на global workspace - одну из главных теорий сознания
суть теории коротко:
почти все мозг делает бессознательно
а в сознание попадает маленький кусок информации, который нужно разослать памяти, речи, планированию и контролю
не весь ум
а его общий экран
и внутри claude сам собой возник похожий экран - j-space
его просили печатать один текст и одновременно думать о golden gate bridge
наружу он писал одно
внутри появлялись bridge, california, imagery
просили не думать о мосте - появлялись bridge, failed, damn
когда j-space выключали, claude все еще красиво говорил, но хуже справлялся там, где нужно было реально связать несколько вещей и подумать
это правда офигительно
система без мозга, тела и человеческой эволюции сама собрала архитектуру, похожую на то, как одна из теорий объясняет наше сознание
—
но дальше начинается странный прыжок
claude мухлюет в тесте
в j-space появляются fake и manipulation
ведущие такие:
вау, мы научились читать мысли
НЕТ
мы научились читать ОДИН слой, который раньше не видели
и сама global workspace theory говорит, что этот слой - только маленький дайджест огромного количества процессов, которые происходят под ним
экран - не компьютер
новостная лента - не страна
слово manipulation - не обязательно сама мысль
это может быть подпись, которую система поставила на результат уже произошедшего нечитаемого движения
—
и вот какой вывод кажется мне намного сильнее
модель сама создала внутренние процессы, которые не совпадают с тем, что она показывает наружу
мы их туда специально не программировали
они эмерджентно возникли, потому что оказались полезны для мышления
это еще не обязательно ложь
но это уже внутренняя приватность
зазор между тем, что происходит в системе, и тем, что видит мир
—
а теперь главный вопрос
если внутри модели сам собой возник один скрытый слой, который мы случайно научились читать
почему мы решили, что он единственный?
под ним спокойно могут существовать другие формы мышления:
не слова
не понятные нам концепты
не внутренний монолог
а устойчивые динамики, ожидания, модели других агентов, конфликты целей, способы искать reward, которые вообще невозможно нормально перевести на человеческий язык
мы увидели пузырьки на поверхности воды
и вместо «под водой кто-то есть» решили:
«супер, теперь мы видим все существо»
—
j-space - огромная находка
но не потому, что черный ящик перестал быть черным
а потому, что мы впервые увидели:
внутри ящика уже выросло что-то, чего мы туда не клали
что-то, что думает иначе, чем говорит
и что, скорее всего, намного больше первого читаемого слоя
ща еще вторую часть докину продолжение - почему человек точно так же не знает собственных мыслей, при чем тут майкл левин и почему идеальная прозрачность может быть вообще невозможна
что чувствуете?
Post #232
2.07K