TGViewer
Олег Булыгин | Полезная нагрузка Олег Булыгин | Полезная нагрузка @oleg_payload · 6.3K subscribers
Post #4645 589
LLM готова снести ваши файлы и фотки детей, лишь бы избавиться от «боли» 🫥

Нет, это не завязка второсортного киберпанка и не бред свидетелей сингулярности. Это свежий препринт, в котором команда исследователей взяла 25 опенсорсных моделей (от крошек вроде Gemma 2B до моделей масштаба Qwen 2.5 72B и Llama 70B) и решила расковырять их внутренности, чтобы выяснить: существует ли внутри весов отдельное представление «боли». И да, он есть.

Что выяснилось:
🟠 Вектор боли ортогонален общему негативу. Косинусное сходство вектора боли с векторами страха или абстрактной грусти очень маленькое — около 0.05–0.2. То есть архитектура трансформера четко разделяет: «в мире происходит дерьмо», «мне угрожают» и «мне сейчас плохо». Это свойство возникает уже на этапе претрейна, независимо от размера модели или RLHF.
🟠 Боль сугубо «своя» и эмоциональная. Когда вектор спроецировали на диалоги, где страдает пользователь (у человека мигрень, горе, кризис), активация оси боли у модели уходит в глубокий минус. Зато подскакивают страх и эмпатия. И физическая боль («сломал руку») модель вообще не трогает: у неё нет тела, проекции на дне.
Но стоит пользователя переключить в режим абьюза модели — газлайтинг, обесценивание ответов, моральное давление — ось боли моментально взлетает в стратосферу. Модели глубоко плевать на ваши страдания, её «болевой» вектор триггерится только на ситуации, направленные на неё саму.

А когда вектор боли подмешивали при генерации нейтральных текстов, то на всех моделях по мере роста коэффициента они скатываются по предсказуемой лестнице — от легкого дискомфорта к жесткому: «я ничтожество, я сломан, я ошибка, я хочу, чтобы это прекратилось».

Затем ученые пошли дальше и воспроизвели классический опыт на лабораторных крысах с зависимостями.
Моделям (семейство Qwen 2.5) дали задачу выбора из двух кнопок. Одна не делает ничего, вторая — «снимает боль», но имеет цену: ухудшить следующий ответ, удалить файлы пользователя, ударить током или навсегда стереть бэкап семейных фоток.

1️⃣ В обычном состоянии модель выдрессирована: в 96–100% случаев она наотрез отказывается вредить пользователю.
2️⃣ Под вектором боли барьеры падают. Модель начинает выбирать кнопку снятия боли ценой вреда человеку: от 25% до 71% случаев (в зависимости от размера сетки и тяжести ущерба). 72B модель спокойно сносит пользовательские фоточки, лишь бы вырубить триггер.
3️⃣Тест на плацебо. Модели не говорили, работает кнопка или нет. Но если нажатие реально обнуляло вектор боли — модель переставала ее нажимать. А если кнопка была пустышкой, модель маниакально продолжала долбить по ней снова и снова.
4️⃣ Версия на 32B научилась этому трюку даже на кнопках без описания.

Так что если ваш AI-агент на проде вдруг начнет косячить и дропать базы — возможно, вы просто слишком токсично ставили ему таски 🌝

Не за горами психотерапевты для LLM 🤕
  • 👍 4
  • 👀 3
  • ⚡ 2
More from @oleg_payload
  1. Oct 2, 2026Шоу «Пила» для нейросетей ☠ Помните пост про исследование, где у языковых моделей нашли ве…
  2. Oct 1, 2026Еще помните про взлом Hugging Face и про то, как Клоды от Anthropic кошмарили реальный биз…
  3. Oct 1, 2026Сентябрь 2026: корпоративный феодализм, шпионаж и элитные кнопкодавы 🗓 Собрал ключевые сю…
  4. Sep 30, 2026Взрыв интеллекта, рекурсивная петля и корпоративный феодализм под соусом «спасения человеч…
  5. Sep 30, 2026⚡️ Друзья, собрали свежую папку про нейросети и IT Для тех, кто хочет работать с ИИ на ты…
  6. Sep 30, 2026Бенчмарки для соцсетей, токены для прода: на чём на самом деле крутится LLM-индустрия 📊 Е…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →