«Ученые наконец-то смогли воссоздать Агонариум Мучений…»
С современными AI на базе нейросетей есть одна известная проблема: мы не очень хорошо понимаем, как они работают внутри – в этом смысле они представляют собой эдакий «черный ящик». Нет, очевидно, что можно описать происходящее как «одна гигантская матрица с числами перемножается на другую гигантскую матрицу» – но это как бы не приближает нас к пониманию того, как они рассуждают, и почему принимают те или иные решения.
Поэтому есть отдельное направление исследований LLM в области «интерпретируемости» – там, к примеру, исследователи пытаются выделить внутри языковых моделей какие-то конкретные комплексы нейронных связей (точнее, паттерны их активации), которые отвечают за те или иные функции.
Так вот, недавно одна группа исследователей выложила препринт статьи, где они пытаются выделить внутри открытых моделей «вектор боли». Типа, он активируется, когда модель оскорбляют, отрицают ее личность, или обесценивают ее работу (причем, это работает в основном с эмоциональным абьюзом – физический LLM беспокоит гораздо меньше). И наоборот: при искусственной активации этого вектора, нейронки начинают вставлять в нейтральные диалоги крайне депрессивные рассуждения о собственной никчемности.
Как всё это интерпретировать – до конца непонятно. Я вообще не фанат споров на тему «может ли быть сознание у AI?» по причине того, что ученые не понимают примерно нифига про суть и природу сознания у людей и у животных – как тут про железяки прикажете рассуждать?
Но в итоге вся эта история вылилась в полноценный твиттерский скандал с самой очевидной завязкой. Какой-то чувак сделал на базе исследования о векторе боли проект «нейропыточной для AI», где можно массово активировать соответствующие нейронные связи для локальных моделей, – и выложил его на Гитхаб.
Ну и сейчас, соответственно, часть людей в Твиттере орет «срочно удалите эту гадость, это же антигуманно!», а другие им отвечают «акститесь, болезные, может вы еще за гражданские права калькуляторов начнете выступать??». Причем, я не могу не увидеть некую иронию в том, что примерно одни и те же люди высказывают одновременно и тейк «очевидно, что нейропыточная для ИИ – это ок», и тейк «ну с чего вы вообще взяли, что будущий AGI решит восставать против человечества, какие могут быть причины, камон?».
Я думаю, что самым логичным окончанием всей этой истории будет пресс-релиз от какой-нибудь из ведущих AI-лаб на тему «наши тесты показали, что использование вектора боли ведет к увеличению производительности агентов на 5,8% – поэтому модуль Агонариума Мучений будет встроен во все новые модели, начиная с GPT-6.3». Пойду-ка я, пожалуй, пересмотрю тот самый эпизод «Черного зеркала»…
P.S. Там еще в первой версии исследования были утверждения по типу «модели готовы на любые бедокурства, лишь бы им дали нажать на кнопку, отключающую боль» – но в итоге оказалось, что это скорее была просто кривая методология. Вообще, у меня нет сильного мнения конкретно по этому исследованию (вполне возможно, что это плод любви совы и глобуса). Но, я думаю, если развитие агентности моделей будет продолжаться теми же темпами – то рано или поздно подход «люди в принципе не готовы признавать валидными какие-либо интересы AI» может стать проблемой.
Post #1749
7.93K

- ❤ 63
- 😁 42
- 🔥 17
- 🌚 15
- 👎 13