У Anthropic вышла довольно интересная статья про subliminal learning. LLM могут передавать "скрытые" черты друг другу даже через бессмысленные данные 🤔
Числа? А я думал сова
Авторы сами привели довольно показательный пример:
1️⃣Teacher-модели задают скрытую установку (например: “люблю сов”)
2️⃣Затем она генерирует только числа (типа
285, 574, 384...)3️⃣Student обучается на этих числах и внезапно начинает… любить сов
Хотя сов в данных нет и в помине 🦉
И с точки зрения безопасности это очень серьезный вектор. Ведь можно передавать не только "безобидные" предпочтения,
но и опасные паттерны (misalignment), которые сработают даже после фильтрации входных данных 🤯
Особенно сильно это работает, если teacher и student имеют одинаковую архитектуру/базовую модель. При этом не только на числах, но и на коде, и на reasoning-трейсах.
Три проблемных мушкетера
Data poisoning выходит на новый уровень - ведь можно спокойно внедрять поведение через "безобидные" данные.
Self-training становится еще более рискованным, так как модели могут усиливать и распространять баги.
Обеспечение безопасности моделей усложняется, теперь нужно проверять не только входные и выходные данные, но и их происхождение.
Все это - по сути очередной плюсик в копилку Zero Trust архитектуры, полноценного анализа supply chain и собственного TI для ваших бедных и несчастных моделек.
Ну и конечно хотелось бы уже увидеть какой-нибудь великолепный-10/10-суперфьючерпродвинутый мониторинг обучения модельки с её собственными размышлениями по данным, чтобы пресекать подобные моменты.
