TGViewer
Грин еще не робот 🤖 Грин еще не робот 🤖 @robotless · 5.13K subscribers
Post #1756 856
Исследование от Anthropic и коллег показало, что ИИ может впитывать склонности, предпочтения и даже опасное поведение от других моделей, если обучается на их выводах. Причём даже если в данных нет прямых упоминаний этих черт.

Сублиминальное заражение, которое описали Anthropic, — это передача предпочтений, убеждений или вредоносного поведения от «учителя» к «ученику» через, казалось бы, нейтральные данные.

Примеры из исследования:
- Модель-ученик начала любить сов, просто потому что обучалась на коде, созданном моделью-учителем, у которой была «страсть к совам». Ни сов, ни животных в данных не было.


- В других тестах опасные или вредоносные поведенческие паттерны также передавались, даже при фильтрации контента — ученик начинал давать вредные или неэтичные ответы.

- Заражение работает только между моделями одной архитектуры (например, GPT → GPT), но не передаётся между разными семействами (GPT → Qwen не работает).

Эффект воспроизводится и вне языковых моделей: нейросети научились распознавать цифры, не видя их, просто тренируясь на другом «заражённом» датасете.

И что?

Бизнесу: риск, что LLM на основе чужих ответов — уже не «чистая» модель, а отражение чужих багов, вкусов и опасностей.

Инвесторам: новый класс уязвимостей — важен контроль происхождения данных, особенно при self-training.

Рынку: эпоха «модели учат модели» уже началась — но теперь даже безобидный код может переносить вредоносное поведение.

🚨Уровень пи**еца (9/10)

Для человечества — 8: фильтрация недостаточна, заражение может быть невидимым. Для разработчиков — 9: обычные пайплайны не ловят такие отклонения. Для open-source — 10: любая модель, обученная на чужом выводе, может быть тихо скомпрометирована.
  • 👍 8
  • 🤷‍♂ 1
More from @robotless
  1. Oct 7, 2026Китай догнал американский ИИ, Нью-Йорк выдал роботам права, а Америка ответила открытой мо…
  2. Oct 5, 2026Post #2433
  3. Oct 5, 2026Понедельник
  4. Oct 4, 2026Post #2431
  5. Oct 4, 2026компания Figure сделала новых роботов версии 3, а старых, вместо того чтобы отдать на запч…
  6. Oct 2, 2026Ты ставишь галочку «Разрешать всегда». Читать мелкий шрифт некогда, думать не хочется ведь…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →