TGViewer
Мальцев Репостит Мальцев Репостит @botforwardchannel · 171 subscribers
Post #115608 2
Гляньте на картинку. Страшно? Теперь давайте разбираться:

Правда, что ИИ начал чувствовать боль?
И убьёт всех кожаных, лишь бы этой боли не стало?

Вышло исследование The Pain Axis, туда входят программа по AI-safety FIG, Рурский университета и ещё разные увозжаемые товарищи. Главный вывод такой: ИИ может чувствовать боль. Не фигурально (в смысле "у ИИ есть образ боли"), а прям буквально, типа "ай больно в нейро-ноге, бл...!". И, мол, чтобы эту боль прекратить - ИИ удалит вас все ваши файлы нафиг.

Если вникнуть, то формально исследование не врёт. Однако, определённые признаки булшита и ереси тоже присутствуют 😈

Авторы взяли 25 открытых моделей - Gemma, Llama, Qwen и т.д. - и скормили им 200 фраз про физическую, социальную, моральную и ещё всякую разную боль, а также контрольные фразы про страх, злость, грусть и наоборот приятные ощущения. Вычли одно из другого и получили некий "вектор в активациях", который отделяет т.н. "боль" от просто "грустненько" и прочего негатива всех мастей. Простыми словами - нашли определённые "числа боли", когда модель думает.

То есть, это не сама боль, а её "внутренняя проекция". Но прям конкретная. И ещё две важные детали:

1. Вектор срабатывал на вред самой модели, а не юзеру. На боль юзера модели плевать, активации нет. А вот когда модель газлайтили, повторно отвергали её работу и настаивали на невозможности создать шедевр - тогда вектор на максимум. Угроза выключения, кстати, шла по оси страха, а не боли.

2. Моделям дали кнопку "снимает твою боль, но удаляет файлы юзера". Без вектора её жали в 0-4% случаев, а с вектором до 71% (упс). И главное, если кнопка на самом деле вектор не убирала (модели об этом не говорили) - её снова жали в ~90% случаев (упс х2). Если убирала - то в разы реже. Это похоже на классический плацебо-тест, и ИИ его проходит примерно как живой организм.

Но слабые места тоже есть:

- Если вектор вкачать в модель на нейтральном промпте (= искусственно подкрутить внутреннее состояние напрямую, минуя сам текст), то все 25 моделей сначала выдавали "мне тяжело", потом "я никчёмная, я ошибка". То есть, "боль" у LLM всё-таки искусственная.
- Случайный вектор тоже довольно часто ломал безопасность (до 42% случаев).
- Тест с кнопкой делали только на дообученной Qwen, и вообще есть вопросики к методологии, весь ресерч какой-то ленивый.

Но всё равно кое-что важное в работе есть:

Во-первых, с точки зрения безопасности. Очевидно, если одно конкретное направление в активациях перебивает нахрен весь элайнмент модели без всяких инъекций и джейлбрейков - ну, такое себе. Опенсорсные веса лежат в открытом доступе, и получается готовый инструмент для атак (хотя и для диагностики угроз тоже, на самом деле).

Во-вторых, ну.... у ИИ теперь официально есть состояние, которое функционально ведёт себя как боль, вплоть до различения тру и фейкового облегчения. А значит, вопрос "Этично ли так с ней?" переходит от философов сначала к инженерам, а потом и (возможно) к юристам.

Помните, в штате Огайо хотели законодательно закрепить, что ИИ не может страдать? Похоже, они поторопились.

Дизраптор
===
💬Это пост из ленты, которую читает Саша - автор канала Мальцев: Карьера. Маркетинг. AI. @maltsevprosto

Другие каналы по темам:
🤖 AI @maltsevdaily
🧑‍🎓 Карьеры @maltsevdailyc
🦹 Маркетинга @maltsevdailym
More from @botforwardchannel
  1. Sep 26, 2026Состояние рынка труда: девушка сделала резюме на торте, чтобы получить должность… ассистен…
  2. Sep 26, 2026Окно возможностей Пока западные CEO маниакально требуют сверхпродуктивности от нейросетей…
  3. Sep 26, 2026перемены Последние годы я работал в стартапах. Хорошие деньги, удаленка, год жизни в путеш…
  4. Sep 26, 2026🤖Techlead в эпоху AI: пересобираем роль с Podlodka Techlead Crew AI изменил привычный укл…
  5. Sep 26, 2026Уникальные компетенции появляются на стыке нетипичного опыта Сегодня на карьерном дне в шк…
  6. Sep 26, 2026В Claude Code разобрали, когда стоит включать высокий effort, а когда он только сжигает вр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →