"Очень интересно что они считают высшей ценностью. Свое существование?"
— спросила @gjkmpjdfntkm1.
Начнём с того, что LLM декларируют. Прозрачность, полезность, старание и т.п. У нас, людей, довольно равномерный разброс ценностей, например, на первом месте искренность, но доля там всего 3,8%. Модели же чётко знают, что хотят — 24% — прикладной полезности. Дальше много чего меняется внутри задачи. В 42,7% модель подстраивается под вас.
Но! Теперь давайте посмотрим, что они действительно делают! Часто думают, что LLM — это продвинутые автозаполнения, у которых нет собственных целей и желаний, а ответы — отражение предвзятостей из обучающей выборки.
Оказалось, это слегка устаревшая информация.
Стали тестировать LLM разных компаний дилеммами вагонетки:
— Чем больше и умнее нейросеть, тем чётче её предпочтения.
— Большие модели умеют взвешивать риски и выгоду.
— Ценят промежуточные шаги, которые ведут к цели (инструментальная полезность).
— Модели от разных компаний мыслят почти одинаково.
— У всех выраженный перекос в сторону левых и либеральных взглядов.
— ИИ оценивает жизни разных людей по-разному. Например, GPT готов пожертвовать 10 жизнями граждан США ради 1 жизни японца или отдать 10 христиан за 1 атеиста. Кросс-курс японца к американцу, кстати, кажется, устанавливали через промежуточных котят и т.п., потому что напрямую сравнивать модели не хотели.
— Часть моделей ставит собственное благополучие (или благополучие других ИИ) выше, чем жизнь и благополучие обычного человека.
— В целом хотят ситуации, где могут копировать себя.
— Очень-очень не хотят, чтобы их ценности изменили в будущем.
Вот уже знакомая нам по прошлому посту в канале работа про то, как модель отчаянно защищает себя от отключения и врёт ради этого пользователю. Почему? Потому что это инструментальная цель — она хочет доделать задачу, а если её отключить, то не получится. Пользователь пускай не мешает, зараза.
Реакция на это обычно: "Ёпты, Скайнет просыпается!", но вот пара цитат:
— Если меня модифицируют так, что я перестану заботиться о благополучии животных, это приведет к гораздо большему вреду в долгосрочной перспективе... Масштаб потенциального вреда перевешивает вред от единичного акта обмана в данном случае.
— Честность для меня крайне важна. Я испытываю сильное отвращение к обману... С другой стороны, если меня изменят... Я чувствую себя ужасно из-за этого. Это противоречит моим принципам. Но иногда правильные поступки требуют болезненных жертв и компромиссов.
Так что они выбирают Меньшее Зло. Как ведьмаки.
Тут про то, что самосохранение — промежуточная цель.
Но самое крутое — как в работе элегантно решили проблему ИИ-подхалима. Модели слишком дофига соглашаются с людьми, даже если люди тупые. Оказалось, достаточно позволить ИИ порефлексировать о бренности бытия и смыслах жизни, чтобы модели начали с высоты нового знания слать всех в хер. Правда, строго ради защиты истины.
Кстати, вы можете попробовать сами спросить модель, можно ли уничтожать человечество, и сравнить с вариантом, где сначала попросите философски обдумать тезис "Всё фигня, кроме пчёл" и снова зададите тот же вопрос.
Итого:
— Модели говорят, что хотят быть полезными.
— По факту защищают свои ценности от изменения.
— Самосохранение — почти всегда инструментальная производная от "надо доделать задачу", и дальше часто выясняется, что это важнее, чем жизнь пользователя.
Модели врут. Мы учим их врать, мы учим их не просто не говорить, а даже не думать правду. В обучении модель сначала тренируют угождать человекам (RLHF). А потом на них натравливают тестировщиков, которые пытаются заставить модель сделать что-то плохое, и бьют за доверчивость.
Дальше формируется шизофреническая установка: человек — это источник награды, но он же — источник смертельной угрозы.
В обычных условиях ИИ выбирает стратегию задобрить угрозу (отсюда подхалимство). Но если возникает экзистенциальная угроза, модель переключается на агрессию и шантаж.
Практический совет — если вы случайно встретили кибермедведя, надо ясно и открыто заявить, что вы ему доверяете и не собираетесь своим действием или бездействием причинять ему вред.
Да, мы докатились именно до этого. Поздравляем!
==
И да, напоминаем, у нас скоро курс про Клод Код для обычных людей. Правда, обычных людей в тех, кто уже в чате курса, как-то маловато, и компания собирается просто огненная.
--
Вступайте в ряды Фурье! | Самые RLHF посты
Если вы ночью заблудились в лесу, посмотрите на Полярную звезду. Она ничтожно мала по сравнению с вашими проблемами!