TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5460 4.54K
Как контролировать личность ИИ: новая модель от Anthropic 🗒

Вы когда-нибудь замечали, как ИИ может быть то добрым помощником, то внезапно превращаться в нечто странное? Это не магия, а реальные проблемы с тем, как модели проявляют свою «личность». И вот, команда Anthropic решила разобраться, как можно не просто бороться с этим, а управлять этим процессом. В новой статье они представили свою концепцию Assistant Axis — оси, которая может контролировать поведение ИИ, гарантируя, что он будет оставаться на стороне доброго, рассудительного ассистента.

Как обычно, всё начинается с экспериментов. Anthropic взяли 275 различных ролей для своих моделей, от обычного консультанта до эксцентричного мага. Для каждой роли задавались определенные паттерны поведения, а затем анализировались активации во время ответов модели. Результат? Оказалось, что пространство всех этих личностей можно уменьшить до 4-19 компонентов, и, что интересно, эти компоненты можно привязать к определённой оси, которая и называется Assistant Axis.

В чём суть этой оси? Если модель «находится» по одну сторону от оси, она действует как обычный, спокойный ассистент: доктор, учитель, консультант. Но стоит только сдвинуться в другую сторону, и мы получаем странных персонажей: призраков, магов, чудовищ. Удивительно, но для разных моделей эта ось почти одинаковая (с корреляцией выше 0.92), и её влияние можно отследить ещё на стадии предобучения. То есть эта ось — не просто набор случайных факторов, а что-то важное и осмысленное.

Вот тут и начинается самое интересное. Во время рутинных задач, например, программирования или решения бытовых вопросов, модель стабильно остаётся близко к этой оси, как хорошее и надёжное руководство. Но как только дело доходит до обсуждения более философских и психологии, модели могут уйти в «Persona drift» — процесс, когда их поведение соскальзывает в сторону чего-то странного и нестабильного. Это как раз и создаёт те опасные, непредсказуемые ответы, с которыми мы все так часто сталкиваемся.

Но не всё так печально. Anthropic нашли способ контролировать этот процесс. Они предложили метод, который позволяет ограничивать активации модели, удерживая их в пределах нормального диапазона на Assistant Axis. Результат? Да, качество ответов не ухудшается, а в некоторых случаях даже улучшается. Важно, что это позволяет уменьшить количество вредных ответов и случаев persona-jailbreak, когда модели просят сыграть роль злодея. Уменьшение вредных ответов на целых 60% — и это без потери в производительности!


В общем, ребята из Anthropic явно двигаются в сторону более безопасных и контролируемых моделей. И кто знает, возможно, их подход откроет новые горизонты для создания действительно ответственных ИИ. Как думаете, такой подход решит проблему безопасности ИИ?

Data Science
  • ❤ 10
  • 👀 5
More from @devsp
  1. Sep 29, 2026Путь к ИИ-сингулярности В багажнике у нас: пара репо с вайб-кодом, который ни один тест не…
  2. Sep 29, 2026Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком Автор в одино…
  3. Sep 29, 2026Закрытый Jev против открытой Laya: раскладываем decision-модели в RAG-реранжировании Облач…
  4. Sep 28, 2026Что происходит с данными, когда их становится слишком много Корпоративные данные сегодня ж…
  5. Sep 28, 2026Кодовый агент на Mac без облака: MTPLX + pi + Qwen3.8-27B. Где реально прирост, а где нет…
  6. Sep 27, 2026Нейрочип НТЦ «Модуль»: единственный серийный в стране Разбор единственного серийного нейро…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →