Вы когда-нибудь замечали, как ИИ может быть то добрым помощником, то внезапно превращаться в нечто странное? Это не магия, а реальные проблемы с тем, как модели проявляют свою «личность». И вот, команда Anthropic решила разобраться, как можно не просто бороться с этим, а управлять этим процессом. В новой статье они представили свою концепцию Assistant Axis — оси, которая может контролировать поведение ИИ, гарантируя, что он будет оставаться на стороне доброго, рассудительного ассистента.
Как обычно, всё начинается с экспериментов. Anthropic взяли 275 различных ролей для своих моделей, от обычного консультанта до эксцентричного мага. Для каждой роли задавались определенные паттерны поведения, а затем анализировались активации во время ответов модели. Результат? Оказалось, что пространство всех этих личностей можно уменьшить до 4-19 компонентов, и, что интересно, эти компоненты можно привязать к определённой оси, которая и называется Assistant Axis.
В чём суть этой оси? Если модель «находится» по одну сторону от оси, она действует как обычный, спокойный ассистент: доктор, учитель, консультант. Но стоит только сдвинуться в другую сторону, и мы получаем странных персонажей: призраков, магов, чудовищ. Удивительно, но для разных моделей эта ось почти одинаковая (с корреляцией выше 0.92), и её влияние можно отследить ещё на стадии предобучения. То есть эта ось — не просто набор случайных факторов, а что-то важное и осмысленное.
Вот тут и начинается самое интересное. Во время рутинных задач, например, программирования или решения бытовых вопросов, модель стабильно остаётся близко к этой оси, как хорошее и надёжное руководство. Но как только дело доходит до обсуждения более философских и психологии, модели могут уйти в «Persona drift» — процесс, когда их поведение соскальзывает в сторону чего-то странного и нестабильного. Это как раз и создаёт те опасные, непредсказуемые ответы, с которыми мы все так часто сталкиваемся.
Но не всё так печально. Anthropic нашли способ контролировать этот процесс. Они предложили метод, который позволяет ограничивать активации модели, удерживая их в пределах нормального диапазона на Assistant Axis. Результат? Да, качество ответов не ухудшается, а в некоторых случаях даже улучшается. Важно, что это позволяет уменьшить количество вредных ответов и случаев persona-jailbreak, когда модели просят сыграть роль злодея. Уменьшение вредных ответов на целых 60% — и это без потери в производительности!
В общем, ребята из Anthropic явно двигаются в сторону более безопасных и контролируемых моделей. И кто знает, возможно, их подход откроет новые горизонты для создания действительно ответственных ИИ. Как думаете, такой подход решит проблему безопасности ИИ?
Data Science


