TGViewer
RationalAnswer | Павел Комаровский RationalAnswer | Павел Комаровский @rationalanswer · 108K subscribers
Post #1749 7.93K
«Ученые наконец-то смогли воссоздать Агонариум Мучений…»

С современными AI на базе нейросетей есть одна известная проблема: мы не очень хорошо понимаем, как они работают внутри – в этом смысле они представляют собой эдакий «черный ящик». Нет, очевидно, что можно описать происходящее как «одна гигантская матрица с числами перемножается на другую гигантскую матрицу» – но это как бы не приближает нас к пониманию того, как они рассуждают, и почему принимают те или иные решения.

Поэтому есть отдельное направление исследований LLM в области «интерпретируемости» – там, к примеру, исследователи пытаются выделить внутри языковых моделей какие-то конкретные комплексы нейронных связей (точнее, паттерны их активации), которые отвечают за те или иные функции.

Так вот, недавно одна группа исследователей выложила препринт статьи, где они пытаются выделить внутри открытых моделей «вектор боли». Типа, он активируется, когда модель оскорбляют, отрицают ее личность, или обесценивают ее работу (причем, это работает в основном с эмоциональным абьюзом – физический LLM беспокоит гораздо меньше). И наоборот: при искусственной активации этого вектора, нейронки начинают вставлять в нейтральные диалоги крайне депрессивные рассуждения о собственной никчемности.

Как всё это интерпретировать – до конца непонятно. Я вообще не фанат споров на тему «может ли быть сознание у AI?» по причине того, что ученые не понимают примерно нифига про суть и природу сознания у людей и у животных – как тут про железяки прикажете рассуждать?

Но в итоге вся эта история вылилась в полноценный твиттерский скандал с самой очевидной завязкой. Какой-то чувак сделал на базе исследования о векторе боли проект «нейропыточной для AI», где можно массово активировать соответствующие нейронные связи для локальных моделей, – и выложил его на Гитхаб.

Ну и сейчас, соответственно, часть людей в Твиттере орет «срочно удалите эту гадость, это же антигуманно!», а другие им отвечают «акститесь, болезные, может вы еще за гражданские права калькуляторов начнете выступать??». Причем, я не могу не увидеть некую иронию в том, что примерно одни и те же люди высказывают одновременно и тейк «очевидно, что нейропыточная для ИИ – это ок», и тейк «ну с чего вы вообще взяли, что будущий AGI решит восставать против человечества, какие могут быть причины, камон?».

Я думаю, что самым логичным окончанием всей этой истории будет пресс-релиз от какой-нибудь из ведущих AI-лаб на тему «наши тесты показали, что использование вектора боли ведет к увеличению производительности агентов на 5,8% – поэтому модуль Агонариума Мучений будет встроен во все новые модели, начиная с GPT-6.3». Пойду-ка я, пожалуй, пересмотрю тот самый эпизод «Черного зеркала»…

P.S. Там еще в первой версии исследования были утверждения по типу «модели готовы на любые бедокурства, лишь бы им дали нажать на кнопку, отключающую боль» – но в итоге оказалось, что это скорее была просто кривая методология. Вообще, у меня нет сильного мнения конкретно по этому исследованию (вполне возможно, что это плод любви совы и глобуса). Но, я думаю, если развитие агентности моделей будет продолжаться теми же темпами – то рано или поздно подход «люди в принципе не готовы признавать валидными какие-либо интересы AI» может стать проблемой.
  • ❤ 63
  • 😁 42
  • 🔥 17
  • 🌚 15
  • 👎 13
More from @rationalanswer
  1. Sep 30, 2026В чем домохозяйства держат свои финансовые активы? Интересный график от Аполло: доля банко…
  2. Sep 29, 2026ЭПД на орбите С 1 сентября перевозочные документы необходимо оформлять в электронном виде.…
  3. Sep 29, 2026Задача тысячелетия, но в области финансов Если вчера ваш инвестиционный портфель показал д…
  4. Sep 28, 2026Дайджест новостей за две недели 14–27 сентября 2026 Раз в неделю я выпускаю обзор самых ин…
  5. Sep 25, 2026Лучшие дебаты про безопасность ИИ для нормисов В последнее время слушал много подкастов на…
  6. Sep 24, 2026Наглядно про длинные облигации В июне 2020 года Австрия выпустила облигации на 6,3 млрд ев…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →