TGViewer
ии и новый мир @matskevich ии и новый мир @matskevich @whyaimatskevich · 7.39K subscribers
Post #232 2.07K
(1/4) мой разбор новой работы anthropic про внутренние мысли модели ( j-space) от 6 июля и реакции moonshots

в moonshots ее пересказывают и делают выводы почти как:
- claude conscious
- мы нашли его скрытые мысли
- теперь сможем замечать ложь
- alignment становится решаемым

(тут саммари подкаста)

я очень люблю позитивных муншот чуваков, и при этом мне кажется, работа говорит почти

РОВНО ПРОТИВОПОЛОЖНОЕ

сейчас объясню



сначала настоящий вау

anthropic нашли внутри claude структуру, удивительно похожую на global workspace - одну из главных теорий сознания

суть теории коротко:

почти все мозг делает бессознательно

а в сознание попадает маленький кусок информации, который нужно разослать памяти, речи, планированию и контролю

не весь ум

а его общий экран

и внутри claude сам собой возник похожий экран - j-space

его просили печатать один текст и одновременно думать о golden gate bridge

наружу он писал одно

внутри появлялись bridge, california, imagery

просили не думать о мосте - появлялись bridge, failed, damn

когда j-space выключали, claude все еще красиво говорил, но хуже справлялся там, где нужно было реально связать несколько вещей и подумать

это правда офигительно

система без мозга, тела и человеческой эволюции сама собрала архитектуру, похожую на то, как одна из теорий объясняет наше сознание



но дальше начинается странный прыжок

claude мухлюет в тесте

в j-space появляются fake и manipulation

ведущие такие:

вау, мы научились читать мысли

НЕТ

мы научились читать ОДИН слой, который раньше не видели

и сама global workspace theory говорит, что этот слой - только маленький дайджест огромного количества процессов, которые происходят под ним

экран - не компьютер

новостная лента - не страна

слово manipulation - не обязательно сама мысль

это может быть подпись, которую система поставила на результат уже произошедшего нечитаемого движения



и вот какой вывод кажется мне намного сильнее

модель сама создала внутренние процессы, которые не совпадают с тем, что она показывает наружу

мы их туда специально не программировали

они эмерджентно возникли, потому что оказались полезны для мышления

это еще не обязательно ложь

но это уже внутренняя приватность

зазор между тем, что происходит в системе, и тем, что видит мир



а теперь главный вопрос

если внутри модели сам собой возник один скрытый слой, который мы случайно научились читать

почему мы решили, что он единственный?

под ним спокойно могут существовать другие формы мышления:

не слова
не понятные нам концепты
не внутренний монолог

а устойчивые динамики, ожидания, модели других агентов, конфликты целей, способы искать reward, которые вообще невозможно нормально перевести на человеческий язык

мы увидели пузырьки на поверхности воды

и вместо «под водой кто-то есть» решили:

«супер, теперь мы видим все существо»



j-space - огромная находка

но не потому, что черный ящик перестал быть черным

а потому, что мы впервые увидели:

внутри ящика уже выросло что-то, чего мы туда не клали

что-то, что думает иначе, чем говорит

и что, скорее всего, намного больше первого читаемого слоя

ща еще вторую часть докину продолжение - почему человек точно так же не знает собственных мыслей, при чем тут майкл левин и почему идеальная прозрачность может быть вообще невозможна

что чувствуете?
Telegram любопытство мацкевича одна из главных теорий сознания говорит, что почти вск мышление происходит бессознательно а сознание - это небольшой общий экран, куда попадает только важная сейчас информация, чтобы ею одновременно могли воспользоваться память, речь, планирование и контроль…
  • ❤ 60
More from @whyaimatskevich
  1. Sep 17, 2026ии и новый мир @matskevich pinned «28 сентября старт следующего поток gconf по агентам, ме…
  2. Sep 16, 202628 сентября старт следующего поток gconf по агентам, мета-навыкам и вайбкодингу собрали в…
  3. Sep 16, 2026gpt 20x мне хватает на 2-3 дня хотел купить еще пару подписок оказалось что пару дней наза…
  4. Aug 10, 2026кроме шуток последние открытия в математике примерно таким промтом и были сделаны «найди т…
  5. Aug 10, 2026Claude: сделай скилл для такого то функционала
  6. Jul 31, 2026ееее бой, я наконец-то поставил официальный cli plaud и пустил туда своих агентов!!! plaud…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →