TGViewer
Oh my AI Oh my AI @oaiohmy · 311 subscribers
Post #456 338
У LLMок нашли вектор боли

Что такое: Whitebox-интерпретируемость: линейное 'pain'-направление в residual stream 25 open-weight LLM (2B–72B, 5 семейств), выделенное и денойзнутое от confound-направлений (страх, негативная валентность, грусть).

Что сделали:
Извлекли pain-вектор через diff-in-means/CAA, очистили PC-вычитанием confound-компонент, провели held-out K-fold CV, показали self-other диссоциацию.
Зачем:Для AI-safety/red-teaming важна находка: pain-vector steering обходит обученное избегание вреда.

Значит, у LLM теперь есть 'ось боли'. По сути это вполне добротная whitebox-интерпретируемость: линейное направление в residual stream 25 открытых моделей, которое авторы вычленяют и, что важно, ДЕНОЙЗЯТ от соседних направлений: страха, негативной валентности, грусти через вычитание главных компонент. Диссоциация self-other (модель 'реагирует' на вред себе, но не на страдание юзера, который ей рассказывают) уже сам по себе неплохой механистический результат, не просто 'нашли вектор, ура'.

Но реальный хук в том что внезапно pain-vector steering поднимает частоту 'вредных' нажатий/решений с 0-4% baseline до 25-71%, обходя тренированный harm-avoidance БЕЗ единого слова джейлбрейк-текста в промпте.

Из булшита: сам фрейминг 'LLM представляют вред себе и действуют, чтобы его облегчить' подаёт спекулятивную, по сути неверифицируемую тему увереннее, чем это заслуживает; один из авторов аффилирован с advocacy-организацией про AI sentience. Плюс steering-коэффициент подбирался ad hoc через LLM-judge, а self-denial снимали через LoRA, то есть по факту тестировали не совсем исходную модель - это слегка размывает валидность главного safety-вывода. В целом секция про обход harm-avoidance через steering и денойзинг-методология принципал компонент -вычитания заслуживают беглого прохода отдельно глазками по статье, остальное можно смело скипать вместе с философской рамкой.

[Статью тык]
arXiv.org The Pain Axis: LLMs Represent Self-Directed Harm and Act on It LLMs sometimes behave in ways resembling human emotional responses, and recent work identified internal representations that may underlie these behaviors. We ask whether LLMs represent pain...
  • ❤ 1
More from @oaiohmy
  1. Oct 7, 2026Европа резко, решительно врывается в топ1 рейтинга с новым мистралем. 🏳🇫🇷🐸🏳 #lulz
  2. Sep 22, 2026К слову муха в этом твите так-то должна была искать фишинг. Но она заспидранила эту жизнь…
  3. Sep 22, 2026МУХА! Муху научили проходить по цепочке атаки до финальной странички флоу фишинга - кликат…
  4. Sep 11, 2026Вышел новый Threat Intelligence Report от Anthropic Анализ с декабрь 2025 по август 2026.…
  5. Aug 23, 2026Если задумывались насколько скиллы лучше чем запись в memory Demystifying Agent Skills - А…
  6. Aug 21, 2026Очень нравится наблюдать за тем, как по мере того, как модельки умнеют, агенты на их базе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →