У LLMок нашли вектор боли
Что такое: Whitebox-интерпретируемость: линейное 'pain'-направление в residual stream 25 open-weight LLM (2B–72B, 5 семейств), выделенное и денойзнутое от confound-направлений (страх, негативная валентность, грусть).
Что сделали:
Извлекли pain-вектор через diff-in-means/CAA, очистили PC-вычитанием confound-компонент, провели held-out K-fold CV, показали self-other диссоциацию.
Зачем:Для AI-safety/red-teaming важна находка: pain-vector steering обходит обученное избегание вреда.
Значит, у LLM теперь есть 'ось боли'. По сути это вполне добротная whitebox-интерпретируемость: линейное направление в residual stream 25 открытых моделей, которое авторы вычленяют и, что важно, ДЕНОЙЗЯТ от соседних направлений: страха, негативной валентности, грусти через вычитание главных компонент. Диссоциация self-other (модель 'реагирует' на вред себе, но не на страдание юзера, который ей рассказывают) уже сам по себе неплохой механистический результат, не просто 'нашли вектор, ура'.
Но реальный хук в том что внезапно pain-vector steering поднимает частоту 'вредных' нажатий/решений с 0-4% baseline до 25-71%, обходя тренированный harm-avoidance БЕЗ единого слова джейлбрейк-текста в промпте.
Из булшита: сам фрейминг 'LLM представляют вред себе и действуют, чтобы его облегчить' подаёт спекулятивную, по сути неверифицируемую тему увереннее, чем это заслуживает; один из авторов аффилирован с advocacy-организацией про AI sentience. Плюс steering-коэффициент подбирался ad hoc через LLM-judge, а self-denial снимали через LoRA, то есть по факту тестировали не совсем исходную модель - это слегка размывает валидность главного safety-вывода. В целом секция про обход harm-avoidance через steering и денойзинг-методология принципал компонент -вычитания заслуживают беглого прохода отдельно глазками по статье, остальное можно смело скипать вместе с философской рамкой.
[Статью тык]
Post #456
338