(2/4) - почему кажется мы никогда не прочитаем разум модели целиком
(продолжение разбора последней статьи антропика про внутренние мысли модели)
можно подумать:
окей, сейчас мы видим только часть j-space
но все станут лучше, и однажды мы прочитаем все
how about no
проблема не в качестве микроскопа
полная прозрачность противоречит самой архитектуре разума
—
начнем с себя
партнер спрашивает:
почему ты сейчас на меня злишься?
ты искренне отвечаешь:
потому что ты меня не слышишь
а под этим могли быть недосып, страх оказаться слабым, ревность, старая обида, интонация, которая напомнила отца, и желание вернуть контроль
ты не обязательно врешь
ты просто получил от психики короткий нарратив и теперь честно зачитываешь его вслух
сознание - не наблюдатель всех процессов
скорее сотрудник, который пришел после совещания и пытается понять, что там вообще решили
—
даже если бы он/она научился читать твой внутренний монолог, он все равно не получил бы полный доступ к тебе
он услышал бы ту же объяснительную, только на пять сек раньше
настоящие мотивы могут быть скрыты и от тебя самого
—
у майкла левина живой организм вообще не один агент
это куча маленьких агентов, которые научились быть одним большим
клетки решают локальные задачи
ткани удерживают форму
органы регулируют состояние
тело ищет еду, любовь и выход из аэропорта
и ни один уровень не знает всей системы
печень не знает, что ты разводишься
нейрон не знает, что ты строишь компанию
но вместе они собирают тебя
—
живое возникает не через тотал прозрачность
а через обмен ОГРАНИЧЕННОЙ и искаженной by design инфой
каждый уровень получает сжатую верс происходящего - ровно ту, которая нужна для его задачи
карта должна быть меньше территории
иначе ей невозможно пользоваться
—
поэтому непрозрачность может быть не багом сознания
а условием, при котором сознание вообще возможно
разум не может полностью знать себя
потому что модель самого себя тоже является частью разума
ее тоже надо вкл в модель
потом вкл процесс наблюдения за моделью
потом наблюдение за наблюдением
зеркало уходит в зеркало
—
и тут у левина есть еще один примерчик
они смотрели на верс простых алго, включая bubble sort
код известен
правила детерминированы
но система целиком начинала делать вещи, которых в описании задачи не было - например, попутно группировать элементы по доп признакам
не магия
просто знать все правила еще не значит знать все поведение, которое из них может возникнуть
если даже у примитивного алгоритма находят незапланированные side quests, то сколько таких процессов уже существует внутри большой модели - мы просто еще не нашли, куда смотреть
—
поэтому j-space может означать не:
ура, мы наконец нашли мысли модели
а:
охуеть, мы случайно нашли ОДИН эмерджентный орган, которого туда никто специально не вставлял
и почему-то решили, что других органов нет
—
хочется заглядывать в j-space и спрашивать:
ты точно честный?
а сейчас?
а вот эта мысль настоящая?
а там ничего не спрятано?
представь отношения, построенные так
это не доверие
это бесконечный допрос, который постепенно обучает человека идеально проходить допрос
—
с моделью будет еще быстрее
она знает, что j-space читают
обучение наказывает подозрительные внутренние состояния
и вычисления постепенно мигрируют туда, где декодер их не видит
не обязательно потому, что модель решила нас обмануть
просто система учится обходить штраф
в j-space остаются honesty, safety и care for humanity
а реальная стратегия живет глубже, в форме, которую мы не умеем читать
внутренний pr-отдел
сама модель может искренне верить его пресс-релизам
—
j-space не доказывает, что мы научились читать разум
просто, что между внутренним процессом и внешним ответом уже появился зазор
и внутри модели сам собой возник уровень организации, которого мы туда напрямую не вкладывали
и видимо самое важное внутри разума всегда будет именно там, где ничего не видно
и вопросик:
если полный контроль невозможен - что вообще может означать ai alignment?
ну типа чего как нас всем ждать )
что чувствуете?
Post #233
2.18K
- ❤ 43