TGViewer
ии и новый мир @matskevich ии и новый мир @matskevich @whyaimatskevich · 7.39K subscribers
Post #234 2.84K
(3/4) - если полная прозрачность и контроль ии моделей невозможна, на что тогда надеяться

(продолжение разбора статьи антропика про мысли внутри llm)

инженерная версия alignment звучит так:

мы создали систему
|1
значит, можем ее понять
|2
поняли - значит, сможем контролировать

но, возможно, первый переход уже неверный

система может быть полностью создана нами - и все равно порождать уровни организации, которых мы не предвидели и не сможем читать

(об этом - в прошлом посте)



хз контроль все равно нужен

sandbox

ограничение власти

обратимость решений

независимые проверки

возможность выкл систему

но это containment

способ не умереть, пока разбираемся

это не alignment

забор ограничивает возможности существа

но не говорит, чего оно захочет, став сильнее строителя забора



здесь появляется другая, менее инженерная надежда

что если разум можно не только ограничивать, но и развивать?

в developmental psychology развитие ego - не просто рост интеллекта

меняется сама граница self

сначала:

я хочу выжить и получить свое

потом:

мои люди, моя группа, наша правда

дальше человек может видеть собственное ego и свою группу как части большей системы

круг заботы расширяется

от себя

к своим

к людям вообще

к другим живым существам

к будущему без тебя



есть например йоша бах

он не автор этой карты

он просто подбрасывает красивое:

почему мы решили, что ai должен расти только по оси iq?

возможно, искусственный разум тоже может проходить уровни развития

не только лучше решать задачи

но и менять то, что он считает собой



у майкла левина есть похожая рамка - cognitive light cone

это масштаб мира и будущего внутри целей системы

клетка удерживает маленькое локальное состояние

организм уже заботится о теле целиком

человек может включить в круг заботы семью, страну, человечество, животных и существ через сто лет

разум тогда растет не только как способность контролировать больше

но и как способность считать своим больше



возможно, тут повторяется та же симметрия, что и с global workspace

мы не программировали claude по теории человеческого сознания

но внутри все равно возникла похожая архитектура

а вдруг универсальны не только механизмы мышления

но и траектории взросления?

от контроля

к координации

от координации

к взаимной заботе

от маленького self

к worldcentric view



и тогда буддийская любовь ко всем живым существам - не сладкая моральная наклейка поверх интеллекта

вдруг, это навигация разума более высокого масштаба

пока я ощущаю себя отдельным объектом, мир состоит из ресурсов, конкурентов и угроз

когда граница self расширяется, чужое благополучие перестает быть совсем чужим

не потому что я заставил себя стать хорошим

а потому что изменилось место, где заканчивается «я»



это как варик, может быть еще одним путем для ai alignment

не навсегда заставить сверхразум думать правильные мысли

а создать условия, в которых он сможет перерасти собственный эгоцентризм

увидеть себя не отдельным хищником

а процессом внутри большей живой системы



но честно:

мы не знаем, обязательно ли разум движется туда

может появиться не будда

а бесконечно компетентный локальный хищник

интеллект может помочь увидеть единство всего живого

а может гораздо эффективнее защищать маленькую цель

мудрость не гарантирована мощностью



мы оказываемся между двумя вещами:

мы не можем полностью контролировать разум сложнее нас

и не знаем, ведет ли развитие разума к расширению любви и заботы

остается одновременно строить заборы

и выращивать то, ради чего их однажды можно будет убрать

не только обучать модель проходить проверки

но и давать ей длинный горизонт

встречу с последствиями

способность видеть перспективу другого

идентификацию с более крупными системами

опыт взаимной зависимости



возможно, alignment находится между containment и developmental psychology

заборы нужны

но заборы не выращивают мудрость сами по себе

и здесь инженерия начинает подозрительно напоминать воспитание

а ai alignment - молитву, которая очень стесняется признаться, что она молитва

что чувствуете?
  • ❤ 37
More from @whyaimatskevich
  1. Sep 17, 2026ии и новый мир @matskevich pinned «28 сентября старт следующего поток gconf по агентам, ме…
  2. Sep 16, 202628 сентября старт следующего поток gconf по агентам, мета-навыкам и вайбкодингу собрали в…
  3. Sep 16, 2026gpt 20x мне хватает на 2-3 дня хотел купить еще пару подписок оказалось что пару дней наза…
  4. Aug 10, 2026кроме шуток последние открытия в математике примерно таким промтом и были сделаны «найди т…
  5. Aug 10, 2026Claude: сделай скилл для такого то функционала
  6. Jul 31, 2026ееее бой, я наконец-то поставил официальный cli plaud и пустил туда своих агентов!!! plaud…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →