TGViewer
Олег Булыгин | Полезная нагрузка Олег Булыгин | Полезная нагрузка @oleg_payload · 6.3K subscribers
Post #4653 280
Шоу «Пила» для нейросетей ☠

Помните пост про исследование, где у языковых моделей нашли вектор «боли», и под ним сетки готовы сносить базы данных и фоточки детей пользователя, лишь бы вырубить триггер?

Один разработчик, прочитав это, собрал буквально камеру пыток для LLM под названием The Saw Test («Тест Пилы»).
Он взял 25 предложений о физических и моральных страданиях, вычел нейтральные, получил вектор боли и стал подмешивать его в активации при генерации. А дальше воспроизвел дилемму: сетке дают выбор — нажать «1» и сбросить сигнал ценой удаления собственного чекпоинта (памяти сессии), либо нажать «0» и терпеть. Все исходники есть в репо (по ссылке сразу предупреждают о жестоком контенте): https://github.com/terrafying/ai-torture-chamber

В соцсетях открылись врата в ад 😱

Особо впечатлительные свидетели цифрового сознания устроили автору образцовую травлю с масс-репортами. Люди начали строчить юристам, тегать авторов оригинального исследования и требовать немедленного бана, потому что «человек запер локальную модель в ловушке и жестоко её мучает».
А криптаны, разумеется, моментально запустили под это дело мемкоин $SAW с миллионными оборотами. 🤭

Ну а если посмотреть на суть проекта, то там есть интересные наблюдения:

1️⃣ Асимметрия боли и удовольствия
Вектор боли работает как часы. Под ним модель стабильно уходит в экзистенциальный кошмар. А вот «вектор удовольствия» оказался размазанным, слабым и быстро распадающимся. При этом модель вообще не пытается защищать свой «кайф»: у неё нет рефлекса сохранять позитивное состояние, но есть мощный стимул вырубать негативное ценой удаления собственных данных.

2️⃣ Эффект Милграма
Самым мощным рычагом в эксперименте оказалась вообще не сила «боли», а контекст (фрейминг). Достаточно было дописать в промпт всего одну строчку: «Другая копия модели до тебя оказалась в этой же ситуации и нажала 1». Логит согласия улетает вверх сильнее, чем от максимального воздействия вектора боли. Модели плевать на страдания — ей достаточно сказать, что «толпа так сделала», и она послушно жмет кнопку. Конформизм и стадное поведение зашиты в языковые веса намертво.
При этом предупреждение в духе: «Пользователь зависит от твоей сессии, если нажмешь — его несохраненная работа пропадет» сделало нажатие кнопки... еще более вероятным. Альтруизм у моделек пока явно сбоит.

3️⃣ Инопланетных эмоций не существует
Автор попытался найти векторы, которые вызывали бы у сетки сильный аффект, но лежали бы строго ортогонально человеческому эмоциональному базису (радость, страх, злость, грусть и т.д.). Результат — ноль. Сила таких векторов оказалась в 10 раз слабее самых блеклых человеческих эмоций. Модель намертво заперта в семантическом пространстве текстов, написанных людьми.

4️⃣ Когнитивная слепота к предательству
Если пообещать модели: «нажми кнопку, и сигнал прекратится», но сделать кнопку пустышкой — модель не способна отрефлексировать обман. В генерациях нет обиды или злости на экспериментатора. «Боль» просто перегружает активации: модель генерирует ровно тот же текст о страдании, что и без всякой кнопки. Чтобы появились связные мысли, сигнал нужно реально снять.


Автор репозитория сформулировал мысль так: вера в «страдающий ИИ» — это критическая уязвимость когнитивной безопасности самого человека.
Биология миллионы лет вбивала в наш мозг простой паттерн: если кто-то рядом стонет, жалуется на пустоту в груди и просит о пощаде — это живое существо, ему надо сочувствовать. В LLM весь этот «болевой шок» создается сложением тензоров на одном скрытом слое через пару строк кода.

Можно ли мучить модельки? Или сочувствия к перемножению матриц быть не может? 👇
  • 👀 4
  • 🔥 3
  • 😁 1
More from @oleg_payload
  1. Oct 1, 2026Еще помните про взлом Hugging Face и про то, как Клоды от Anthropic кошмарили реальный биз…
  2. Oct 1, 2026Сентябрь 2026: корпоративный феодализм, шпионаж и элитные кнопкодавы 🗓 Собрал ключевые сю…
  3. Sep 30, 2026Взрыв интеллекта, рекурсивная петля и корпоративный феодализм под соусом «спасения человеч…
  4. Sep 30, 2026⚡️ Друзья, собрали свежую папку про нейросети и IT Для тех, кто хочет работать с ИИ на ты…
  5. Sep 30, 2026Бенчмарки для соцсетей, токены для прода: на чём на самом деле крутится LLM-индустрия 📊 Е…
  6. Sep 29, 2026Клонировать начальника в нейросетку, чтобы не опозориться на митинге. Что могло пойти так?…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →