Исследование от Anthropic и коллег показало, что ИИ может впитывать склонности, предпочтения и даже опасное поведение от других моделей, если обучается на их выводах. Причём даже если в данных нет прямых упоминаний этих черт.
Сублиминальное заражение, которое описали Anthropic, — это передача предпочтений, убеждений или вредоносного поведения от «учителя» к «ученику» через, казалось бы, нейтральные данные.
Примеры из исследования:
- Модель-ученик начала любить сов, просто потому что обучалась на коде, созданном моделью-учителем, у которой была «страсть к совам». Ни сов, ни животных в данных не было.
- В других тестах опасные или вредоносные поведенческие паттерны также передавались, даже при фильтрации контента — ученик начинал давать вредные или неэтичные ответы.
- Заражение работает только между моделями одной архитектуры (например, GPT → GPT), но не передаётся между разными семействами (GPT → Qwen не работает).
Эффект воспроизводится и вне языковых моделей: нейросети научились распознавать цифры, не видя их, просто тренируясь на другом «заражённом» датасете.
И что?
Бизнесу: риск, что LLM на основе чужих ответов — уже не «чистая» модель, а отражение чужих багов, вкусов и опасностей.
Инвесторам: новый класс уязвимостей — важен контроль происхождения данных, особенно при self-training.
Рынку: эпоха «модели учат модели» уже началась — но теперь даже безобидный код может переносить вредоносное поведение.
🚨Уровень пи**еца (9/10)
Для человечества — 8: фильтрация недостаточна, заражение может быть невидимым. Для разработчиков — 9: обычные пайплайны не ловят такие отклонения. Для open-source — 10: любая модель, обученная на чужом выводе, может быть тихо скомпрометирована.
Post #1756
856

- 👍 8
- 🤷♂ 1