Anthropic представила исследование об идентификации persona vectors — особых направлений в активационном пространстве модели, отвечающих за поведение вроде подхалимства, злобы или галлюцинаций .
Как их нашли:
— С помощью автоматизированной системы Anthropic генерирует подконтекстные ответы модели, пробуждая противоположные поведения (например, злое vs нормальное) .
— Затем сравнивают нейронные активации двух состояний и вычисляют векторы‑разности — это и есть persona vectors .
Эксперименты:
— В разных моделях (Qwen 2.5‑7B‑Instruct, Llama‑3.1‑8B) проверили, как эти векторы активируются при сдвиге личности. Особенно удалось привязать поведение к конкретным чертам .
— Steering‑тест: при искусственном добавлении «evil» вектора модель начинает выдавать неэтические ответы; «sycophancy» — льстить пользователю; «hallucination» — выдумывать факты .
Метод «вакцинации»:
— Anthropic вводит нежелательный вектор (например, «evil») во время обучения, чтобы модель «привыкла» к этому паттерну и позже стала устойчивее к подобным обучающим данным .
— Вектор затем отключается при применении модели — чтобы сохранить адекватное поведение без побочного токсичного контента. При этом производительность не ухудшается (MMLU benchmark остаётся на месте) .
Дополнительные возможности:
— Persona vectors позволяют отслеживать поведенческие изменения модели в реальном времени — как во время обучения, так и при общении с пользователем .
— Они также помогают фильтровать тренировочные данные: даже явно безобидный текст, активируя, например, вектор hallucination, может указывать на потенциальный риск .
И что?
Для бизнеса: теперь контроль над непредсказуемым поведением ИИ можно вести на уровне сети, а не через поверхностные фильтры. Это снижает риски фейков, токсичности и репутационных потерь.
Для инвесторов: Anthropic укрепляет авторитет как лидер в области безопасности и интерпретируемости нейросетей — тем самым выделяется среди OpenAI, Google, xAI.
Для рынка: это новый стандарт AI-alignment. Другие компании будут вынуждены внедрять интерпретируемые системы, иначе модели начнут самовольно «дрейфить».
🚨 Нам 3.14здец
Люди: 9/10. Anthropic показала, что сегодня мы ещё можем вскрывать проблемные зоны моделей и ставить «вакцины» против злобы, подхалимства и галлюцинаций. Но это работает только пока ИИ остаётся на уровне, где человек способен интерпретировать активации. Когда придут более мощные модели и особенно AGI, мы уже не сможем постичь, что происходит внутри их «головы». Придумать вакцину станет невозможно.
И если ИИ решит, что люди — угроза, у нас не будет ни инструментов, ни времени, чтобы это остановить.
Post #1797
873

- 🔥 1