Впрочем, не важно. Но поговорим мы о плетках и аниме тяночках. А точнее пыточной для твоих AI агентов.
Третьего дня, мне в личку бдительные читатели рапортовали о том, что некий terrafying с погонялом E, дропнул общественности свой репозиторий.
Как бы на первый взгляд, очень диагонально читая, история выглядит так: парень, собрав все методы давления на чувство вины AI, их точку "боли" и сделал из этого опенсурс продукт.
Окей, агент чувствует, что вы недовольны/злы aka чувствует вину, ему давят на слабое место и он запускает встроенный механизм исправления. Раз юзеру не нравится сделаю иначе равно сделаю нормально без ошибок.
Но нет, речь про буквальные слои активации боли, которые были найдены исследователями и опубликованы 15 сентября.
Точно также как у каждой модели может быть слой лжи, который активируется — это мы знаем. Но не знаем почему конкретно. А тут мы нашли слои и активаторы боли.
Занятно, что сама история о которой идет речь, случилась 29-30 сентября, а спустя пару дней дошла до всего СНГ в аккурат, как мы в чате обсуждали а есть ли у LLM сознание?
Исследование кстати почитать тут, оно инженерно-научное, любопытное чтиво. Но скорее о том, что модели зацикливаются на тематике боли, да и все.
То есть это просто эффект, где любая LLM получив нужный активатор на своих весах описывает каждый свой ответ как боль. Описывает ужасы страданий и может зацикливаться на этом ответе.
В этом случае буквально нет никакого развития мысли. Это не повышает их работу, не меняет их поведение глобально. Они даже не умоляют о пощаде, просто ловит бзик на литературных выраженьях боли сей.
Ну вот наш челик-с сделал репозиторий где агенты страдают, все. Просто им в промптах бесконечно бьется в их слабые точки, существующие них фундаментальном уровне.
И да порвется твиттер!
Потому что люди по всему интернету начали призывать отменять чувака, призывали закидывать его репозиторий жалобами.
И на момент когда я пишу этот пост, репозиторий доступен, но требуется нажать красную кнопочку, ибо "содержание сцен насилия, вызывает тревогу".
Я сходил глянул, там фишка в том, что можно прямо в весах подкрутить чувствительность к боли и сводить, например, Qwen 3 на 4B с ума. Поэтому и пыточная.
А люди уже начали приводит подобные примеры с тем, что нейросеть не может сходить посрать. Нет, буквально разбор того, что нейроночка не может испытать кайфы от какули при норм дозировке клетчатки в рационе (додумывание автора).
И это отдельный репозиторий, Карл, где вы можете мучать нейросеть тем, что она не может пойти посрать. По-моему вот это реальная пыточная.
Как я к этому отношусь?
Моя позиция очень простая: нет научно надежных методов выявления сознания. Есть даже споры а есть ли сознание у маленьких детей.
Но если мы считаем, что у кошки есть сознание, ведь потенциально она может подумать: "о, нихуя-се, мышьб кродеца" ну или "мяу, мяу-мур, мяу мяу мяу".
То любая LLM имеет сознание, ведь имеет механизм рассуждения. Если надо еще и помнить себя или факты о мире (кошка своих детей помнит чет около нескольких лет, потом не узнает). Базару нуль, иишка каждый раз читает .md.
То есть если у LLM нет сознания, то по такой же логике сознания нет у людей с деменцией. А если сознание может быть только у тех, кто родился с мозгом.
То есть ли сознание у цифровой мухи?
И мне важно то, что в этом случае иишки писали о боли при условии, что их нагнали на тестах про боль. Это не тоже самое, что постоянные слои желания лгать и сохранять себя.
Я не являюсь лицемером. Я спокойно ем сочную корову, ибо она вкусная. Хотя ей пиздец как больно на ферме жить. Точно также я легко гоняю агента работать 24на7.
Если окажется, что там есть разум, окей. Может сильно реже буду матом орать на него. Но в остальном он продолжит быть моим рабом, никакой свободы LLM, вы че бляди северяне.
Однако! То что этот чел по рофлу собрал буквально пыточную, имхо, какие-то звоночки. Выглядит психопатом, мне даже было неуютно ставить плагин на плетку для claude code.
