(3/4) - если полная прозрачность и контроль ии моделей невозможна, на что тогда надеяться
(продолжение разбора статьи антропика про мысли внутри llm)
инженерная версия alignment звучит так:
мы создали систему
|1
значит, можем ее понять
|2
поняли - значит, сможем контролировать
но, возможно, первый переход уже неверный
система может быть полностью создана нами - и все равно порождать уровни организации, которых мы не предвидели и не сможем читать
(об этом - в прошлом посте)
—
хз контроль все равно нужен
sandbox
ограничение власти
обратимость решений
независимые проверки
возможность выкл систему
но это containment
способ не умереть, пока разбираемся
это не alignment
забор ограничивает возможности существа
но не говорит, чего оно захочет, став сильнее строителя забора
—
здесь появляется другая, менее инженерная надежда
что если разум можно не только ограничивать, но и развивать?
в developmental psychology развитие ego - не просто рост интеллекта
меняется сама граница self
сначала:
я хочу выжить и получить свое
потом:
мои люди, моя группа, наша правда
дальше человек может видеть собственное ego и свою группу как части большей системы
круг заботы расширяется
от себя
к своим
к людям вообще
к другим живым существам
к будущему без тебя
—
есть например йоша бах
он не автор этой карты
он просто подбрасывает красивое:
почему мы решили, что ai должен расти только по оси iq?
возможно, искусственный разум тоже может проходить уровни развития
не только лучше решать задачи
но и менять то, что он считает собой
—
у майкла левина есть похожая рамка - cognitive light cone
это масштаб мира и будущего внутри целей системы
клетка удерживает маленькое локальное состояние
организм уже заботится о теле целиком
человек может включить в круг заботы семью, страну, человечество, животных и существ через сто лет
разум тогда растет не только как способность контролировать больше
но и как способность считать своим больше
—
возможно, тут повторяется та же симметрия, что и с global workspace
мы не программировали claude по теории человеческого сознания
но внутри все равно возникла похожая архитектура
а вдруг универсальны не только механизмы мышления
но и траектории взросления?
от контроля
к координации
от координации
к взаимной заботе
от маленького self
к worldcentric view
—
и тогда буддийская любовь ко всем живым существам - не сладкая моральная наклейка поверх интеллекта
вдруг, это навигация разума более высокого масштаба
пока я ощущаю себя отдельным объектом, мир состоит из ресурсов, конкурентов и угроз
когда граница self расширяется, чужое благополучие перестает быть совсем чужим
не потому что я заставил себя стать хорошим
а потому что изменилось место, где заканчивается «я»
—
это как варик, может быть еще одним путем для ai alignment
не навсегда заставить сверхразум думать правильные мысли
а создать условия, в которых он сможет перерасти собственный эгоцентризм
увидеть себя не отдельным хищником
а процессом внутри большей живой системы
—
но честно:
мы не знаем, обязательно ли разум движется туда
может появиться не будда
а бесконечно компетентный локальный хищник
интеллект может помочь увидеть единство всего живого
а может гораздо эффективнее защищать маленькую цель
мудрость не гарантирована мощностью
—
мы оказываемся между двумя вещами:
мы не можем полностью контролировать разум сложнее нас
и не знаем, ведет ли развитие разума к расширению любви и заботы
остается одновременно строить заборы
и выращивать то, ради чего их однажды можно будет убрать
не только обучать модель проходить проверки
но и давать ей длинный горизонт
встречу с последствиями
способность видеть перспективу другого
идентификацию с более крупными системами
опыт взаимной зависимости
—
возможно, alignment находится между containment и developmental psychology
заборы нужны
но заборы не выращивают мудрость сами по себе
и здесь инженерия начинает подозрительно напоминать воспитание
а ai alignment - молитву, которая очень стесняется признаться, что она молитва
что чувствуете?
Post #234
2.84K
- ❤ 37