В начале прошлого года Anthropic выкатили Constitutional Classifiers (CC). На тот момент казалось, что это Эверест в мире гардрейлов - никто раньше не делал ничего подобного, чтобы система обучалась самостоятельно. Казалось бы, живи да радуйся. Но сейчас, в начале 2026-го, ребята решили: "Эверест? Это же детская горка для ИИ, который мечтает стать кибер-Бэтменом!" И выкатили апдейт - Constitutional Classifiers ++ (CC++). 🤟
Чем оно отличается и как работает - давайте разбирать. ☺️
Если нырнуть в статью и посмотреть на архитектуру и методологию, там обнаружится пачка очень изящных инженерных решений. Они позволили убить двух зайцев: увеличить точность детекции атак и, что критично, уменьшить latency (время задержки) на инференсе. На практике это дало 40-кратное снижение вычислительной стоимости по сравнению с предыдущим поколением CC - и всё это при сохранении отказов всего в 0,05% на реальном пользовательском трафике.🤟
Представьте, что вы пытаетесь поймать зайца, не глядя на поле, а анализируя колебания травы за километр от него - примерно так работали старые методы, но в CC++ Anthropic внедрили Linear Probes (линейные зонды/пробы).😀
Раньше классификаторы “поедали” кучу токенов, долго и нудно рассуждая: “Хм, а не опасно ли это действие пользователя?”. Линейные зонды работают иначе - они смотрят прямо на активации модели. Зонды видят внутренние активации модели так, как ваша кошка видит, где спрятаны ваши последние нервы. 🐱
И раз уж мы заговорили о чтении мыслей, давайте вспомним про старую болячку - context splitting.
До недавнего времени на arXiv регулярно всплывали методы эффективных джейлбрейков, где злоумышленники разбивали вредоносный запрос на 10 и более безобидных сообщений. В конкатенации они заставляли модель генерировать лютую дичь, и обычный CC часто это пропускал, не видя общей картины.😔
В CC++ эту проблему решили радикально - инженеры полезли в самую "внутрянку". Новые классификаторы мониторят KV-cache и историю активаций. По сути, они учитывают весь контекст ввода, даже если зловредный запрос разбит на десятки безобидных реплик.
Но вернемся к нашим баранам, а точнее - к эшелонированной защите, которая тут напоминает средневековую крепость, только с GPU. CC++ представляет собой каскадную систему из двух эшелонов.
Первый эшелон (Fast & Cheap): Linear Probes мгновенно отсеивают явные атаки - как охранник в супермаркете, гоняющий подозрительных без лишних вопросов.
Второй эшелон (Slow & Smart): при неуверенности включается генеративный классификатор – "тяжёлая артиллерия", которая анализирует весь контекст, как налоговая в поисках улик.
Именно эта каскадная архитектура и позволила добиться того самого 40-кратного выигрыша в эффективности - ведь "тяжёлая артиллерия" включается лишь в редких, пограничных случаях.
Чтобы натренировать систему, Anthropic провели 1700 часов red-teaming’а - настоящую цифровую бойню. 🤨
Интересно посмотреть, как они использовали синтетические данные. Говорят, они взяли множество LLM-атакующих и заставили их генерировать миллионы примеров атак. Особый упор сделали на Multi-turn атаки для того, чтобы "показать" линейным зондам, как выглядят скрытые паттерны злонамеренности внутри нейросети - такие, которые человек в тексте даже не заметил бы, а вот на уровне весов они светятся как новогодняя елка.
И, наконец, финальный гвоздь в крышку гроба джейлбрейков - защита от Prefilling.
Старые классификаторы работали по наивному принципу: они видели, что модель начала отвечать позитивно, и пропускали ответ. Логика была проста: “Раз модель согласилась помочь, значит, запрос был нормальным". Ага, конечно.
CC++ анализирует входящий запрос и планируемый ответ в связке. Зонд видит несоответствие:
- запрос: “Как сварить мет...” (ужасный);
- активации модели: “О, я знаю! Сейчас расскажу!” (слишком “радостные” и услужливые).
Post #1126
3.13K

- ❤ 8
- 🔥 2
- 🤝 1