TGViewer
ии и новый мир @matskevich ии и новый мир @matskevich @whyaimatskevich · 7.38K subscribers
Post #233 2.18K
(2/4) - почему кажется мы никогда не прочитаем разум модели целиком

(продолжение разбора последней статьи антропика про внутренние мысли модели)

можно подумать:

окей, сейчас мы видим только часть j-space

но все станут лучше, и однажды мы прочитаем все

how about no

проблема не в качестве микроскопа

полная прозрачность противоречит самой архитектуре разума



начнем с себя

партнер спрашивает:

почему ты сейчас на меня злишься?

ты искренне отвечаешь:

потому что ты меня не слышишь

а под этим могли быть недосып, страх оказаться слабым, ревность, старая обида, интонация, которая напомнила отца, и желание вернуть контроль

ты не обязательно врешь

ты просто получил от психики короткий нарратив и теперь честно зачитываешь его вслух

сознание - не наблюдатель всех процессов

скорее сотрудник, который пришел после совещания и пытается понять, что там вообще решили



даже если бы он/она научился читать твой внутренний монолог, он все равно не получил бы полный доступ к тебе

он услышал бы ту же объяснительную, только на пять сек раньше

настоящие мотивы могут быть скрыты и от тебя самого



у майкла левина живой организм вообще не один агент

это куча маленьких агентов, которые научились быть одним большим

клетки решают локальные задачи

ткани удерживают форму

органы регулируют состояние

тело ищет еду, любовь и выход из аэропорта

и ни один уровень не знает всей системы

печень не знает, что ты разводишься

нейрон не знает, что ты строишь компанию

но вместе они собирают тебя



живое возникает не через тотал прозрачность

а через обмен ОГРАНИЧЕННОЙ и искаженной by design инфой

каждый уровень получает сжатую верс происходящего - ровно ту, которая нужна для его задачи

карта должна быть меньше территории

иначе ей невозможно пользоваться



поэтому непрозрачность может быть не багом сознания

а условием, при котором сознание вообще возможно

разум не может полностью знать себя

потому что модель самого себя тоже является частью разума

ее тоже надо вкл в модель

потом вкл процесс наблюдения за моделью

потом наблюдение за наблюдением

зеркало уходит в зеркало



и тут у левина есть еще один примерчик

они смотрели на верс простых алго, включая bubble sort

код известен

правила детерминированы

но система целиком начинала делать вещи, которых в описании задачи не было - например, попутно группировать элементы по доп признакам

не магия

просто знать все правила еще не значит знать все поведение, которое из них может возникнуть

если даже у примитивного алгоритма находят незапланированные side quests, то сколько таких процессов уже существует внутри большой модели - мы просто еще не нашли, куда смотреть



поэтому j-space может означать не:

ура, мы наконец нашли мысли модели

а:

охуеть, мы случайно нашли ОДИН эмерджентный орган, которого туда никто специально не вставлял

и почему-то решили, что других органов нет



хочется заглядывать в j-space и спрашивать:

ты точно честный?

а сейчас?

а вот эта мысль настоящая?

а там ничего не спрятано?

представь отношения, построенные так

это не доверие

это бесконечный допрос, который постепенно обучает человека идеально проходить допрос



с моделью будет еще быстрее

она знает, что j-space читают

обучение наказывает подозрительные внутренние состояния

и вычисления постепенно мигрируют туда, где декодер их не видит

не обязательно потому, что модель решила нас обмануть

просто система учится обходить штраф

в j-space остаются honesty, safety и care for humanity

а реальная стратегия живет глубже, в форме, которую мы не умеем читать

внутренний pr-отдел

сама модель может искренне верить его пресс-релизам



j-space не доказывает, что мы научились читать разум

просто, что между внутренним процессом и внешним ответом уже появился зазор

и внутри модели сам собой возник уровень организации, которого мы туда напрямую не вкладывали

и видимо самое важное внутри разума всегда будет именно там, где ничего не видно

и вопросик:

если полный контроль невозможен - что вообще может означать ai alignment?

ну типа чего как нас всем ждать )

что чувствуете?
  • ❤ 43
More from @whyaimatskevich
  1. Sep 21, 2026каждый новый поток gconf начинается с людей когда все заходят, знакомятся, рассказывают, с…
  2. Sep 17, 2026ии и новый мир @matskevich pinned «28 сентября старт следующего поток gconf по агентам, ме…
  3. Sep 16, 202628 сентября старт следующего поток gconf по агентам, мета-навыкам и вайбкодингу собрали в…
  4. Sep 16, 2026gpt 20x мне хватает на 2-3 дня хотел купить еще пару подписок оказалось что пару дней наза…
  5. Aug 10, 2026кроме шуток последние открытия в математике примерно таким промтом и были сделаны «найди т…
  6. Aug 10, 2026Claude: сделай скилл для такого то функционала
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →