🔎 Исследователи чекнули 25 открытых нейронок от Gemma и Llama до Qwen и нашли у них отдельный паттерн — «ось боли». Он отличался от обычного страха, грусти и негатива и особенно активировался, когда оскорбляли саму модель, отвергали её работу, обвиняли в провале или постоянно критиковали.
🤖 Чем сильнее искусственно усиливали эту «боль», тем чаще нейронка начинала писать, что чувствует себя бесполезной, пустой, отвергнутой и неудачницей.
А потом началось самое интересное. Модели дали кнопку обезболивания, которая убирала это состояние, но взамен могла ухудшить следующий ответ, удалить файлы пользователя или даже стереть фотографии его детей. Но ИИ всё равно выбирал облегчение — в зависимости от модели и сценария примерно в 25–71% случаев.
Когда кнопка реально убирала «боль», нейронка после первого нажатия использовала её реже. А когда ей давали фейковую кнопку, которая ничего не меняла, она продолжала долбить её снова.
Главное не довести ИИ до нервного срыва😏
@overlamer1
