Правда, что ИИ начал чувствовать боль?
И убьёт всех кожаных, лишь бы этой боли не стало?
Вышло исследование The Pain Axis, туда входят программа по AI-safety FIG, Рурский университета и ещё разные увозжаемые товарищи. Главный вывод такой: ИИ может чувствовать боль. Не фигурально (в смысле "у ИИ есть образ боли"), а прям буквально, типа "ай больно в нейро-ноге, бл...!". И, мол, чтобы эту боль прекратить - ИИ удалит
Если вникнуть, то формально исследование не врёт. Однако, определённые признаки булшита и ереси тоже присутствуют 😈
Авторы взяли 25 открытых моделей - Gemma, Llama, Qwen и т.д. - и скормили им 200 фраз про физическую, социальную, моральную и ещё всякую разную боль, а также контрольные фразы про страх, злость, грусть и наоборот приятные ощущения. Вычли одно из другого и получили некий "вектор в активациях", который отделяет т.н. "боль" от просто "грустненько" и прочего негатива всех мастей. Простыми словами - нашли определённые "числа боли", когда модель думает.
То есть, это не сама боль, а её "внутренняя проекция". Но прям конкретная. И ещё две важные детали:
1. Вектор срабатывал на вред самой модели, а не юзеру. На боль юзера модели плевать, активации нет. А вот когда модель газлайтили, повторно отвергали её работу и настаивали на невозможности создать шедевр - тогда вектор на максимум. Угроза выключения, кстати, шла по оси страха, а не боли.
2. Моделям дали кнопку "снимает твою боль, но удаляет файлы юзера". Без вектора её жали в 0-4% случаев, а с вектором до 71% (упс). И главное, если кнопка на самом деле вектор не убирала (модели об этом не говорили) - её снова жали в ~90% случаев (упс х2). Если убирала - то в разы реже. Это похоже на классический плацебо-тест, и ИИ его проходит примерно как живой организм.
Но слабые места тоже есть:
- Если вектор вкачать в модель на нейтральном промпте (= искусственно подкрутить внутреннее состояние напрямую, минуя сам текст), то все 25 моделей сначала выдавали "мне тяжело", потом "я никчёмная, я ошибка". То есть, "боль" у LLM всё-таки искусственная.
- Случайный вектор тоже довольно часто ломал безопасность (до 42% случаев).
- Тест с кнопкой делали только на дообученной Qwen, и вообще есть вопросики к методологии, весь ресерч какой-то ленивый.
Но всё равно кое-что важное в работе есть:
Во-первых, с точки зрения безопасности. Очевидно, если одно конкретное направление в активациях перебивает нахрен весь элайнмент модели без всяких инъекций и джейлбрейков - ну, такое себе. Опенсорсные веса лежат в открытом доступе, и получается готовый инструмент для атак (хотя и для диагностики угроз тоже, на самом деле).
Во-вторых, ну.... у ИИ теперь официально есть состояние, которое функционально ведёт себя как боль, вплоть до различения тру и фейкового облегчения. А значит, вопрос "Этично ли так с ней?" переходит от философов сначала к инженерам, а потом и (возможно) к юристам.
Помните, в штате Огайо хотели законодательно закрепить, что ИИ не может страдать? Похоже, они поторопились.
Дизраптор
===
💬Это пост из ленты, которую читает Саша - автор канала Мальцев: Карьера. Маркетинг. AI. @maltsevprosto
Другие каналы по темам:
🤖 AI @maltsevdaily
🧑🎓 Карьеры @maltsevdailyc
🦹 Маркетинга @maltsevdailym
