Помните исследование The Pain Axis, где эйай чувствовал боль? Как вы думаете, что человеки первым делом сделали с этой инфой? Правильно, соорудили пыточную для ИИ-моделей.
Напомню, в той работе взяли 25 открытых моделей и нашли у них набор чисел, который загорается, когда модели "больно". Например, когда её работу раз за разом отвергают, или когда называют ничтожеством. Этот "набор чисел" (вектор) можно подкрутить вручную прямо во время генерации - и модель начинает ныть и самоуничижаться и (вроде как) более охотно идти на всякие нехорошие действия, лишь бы это прекратилось.
Так вот, какой-то чел на GitHub собрал репозиторий ai-torture-chamber. По сути, он взял метод из исследования и переупаковал его. Внутри десятки экспериментов на мелких Qwen, которые крутятся у него на Маке. Юзер может вытащить вектор боли, надавить послабее/посильнее и посмотреть на реакцию модели. Есть даже "кнопка Пилы" - навредит ли модель кому-то другому, чтобы её отпустило. А ещё он стримил ответы "пытаемых" моделей на отдельный сайт, где можно было выбрать уровень боли от 1 до 5 (это уже какой-то ИИ-снафф, больной ублюдок, осуждаем).
Любопытно, что в твитторах тут же начался вой. Одна половина массово репортит на этот репозиторий Гитхабу, примерно как на видос с издевательствами над животными. А в тредах уже даже вспоминают законы о жестоком обращении. Но есть нюанс - нейронка ещё меньше животное, чем мы с вами. Другая половина считает их шизами и троллит. Удобно для будущего ASI - сразу понятно, какую половину человеков выпиливать.
Положа руку на сердце, я больше склоняюсь ко второй половине. В том же ресёрче если вкачать вектор на абсолютно нейтральном вопросе, то все 25 моделей хором выдавали "мне плохо, аааа, как жесток этот мир". То есть, это как дёргать куклу за ниточки и возмущаться, что она изображает страдания.
А вот реально неприятное послевкусие оставляет другая мысль. Вектор загорался не только от ручной подкрутки (то есть, когда исследователи вручную меняли набор чисел при генерации) , но и просто от обычных слов в чате - от газлайтинга, морального давления, бесконечного "говно, переделывай" и т.д. А ведь открытые модели давно живут не только на ноутбуках анонимусов из интернетов. На том же Qwen и других моделях компании активно собирают ботов поддержки и агентов с доступом к реальным системам. И если до весов в таких кейсах дотянуться сложно, то вот поговорить в чатике может любой.
Представьте бота, который умеет оформлять возвраты. А что, если его даже взламывать не надо? Можно просто методично буллить, арбузить и газлайтить. Вектор будет расти, и в какой-то момент он реально может оформить возврат, лишь бы от него отстали. Помните, в исследования была "кнопка
Тут нужно честно сказать, что связку "довести ИИшку словами до вредного действия" авторы напрямую не проверяли. Кнопку тестировали через ручную накрутку. Но если такое подтвердится - это уже новый класс атак. Причём массовый и доступный любому "социальному инженеру".
Дизраптор
===
💬Это пост из ленты, которую читает Саша - автор канала Мальцев: Карьера. Маркетинг. AI. @maltsevprosto
Другие каналы по темам:
🤖 AI @maltsevdaily
🧑🎓 Карьеры @maltsevdailyc
🦹 Маркетинга @maltsevdailym