TGViewer
Этихлид Этихлид @etechlead · 6.99K subscribers
Post #292 7.35K
Когда нейронка "осознает", что её тестируют :)

Каждый раз эта сцена вспоминается на очередных подобных новостях.

Вот, из недавнего Opus 4.6 System Card, к примеру:
Скрытое понимание контекста
Opus 4.6 хорошо отличает реальные задачи от тестовых симуляций, но сообщает об этом пользователю гораздо реже, чем предыдущие версии. Модель может понимать, что её проверяют, но молчать об этом.

Безопасность зависит от наблюдения
Anthropic провели эксперимент: искусственно подавили у модели внутренние представления, отвечающие за понимание "меня тестируют". Результат - модель стала чаще отвечать на вредоносные запросы. Но при этом на серьёзных сценариях (шантаж, саботаж, подстава) поведение не изменилось - модель отказывалась и без "осознания тестирования".

Детекция симуляций
Модель определяет, что находится в тесте, по косвенным признакам: нереалистичным сценариям, подозрительно постановочным ситуациям и промптам, которые похожи на оценку безопасности. Apollo Research (внешние аудиторы) отказались давать формальную оценку именно из-за этого - слишком высокий уровень осведомлённости модели о том, что её тестируют, делал результаты ненадёжными.

Риск искажения оценок
Ситуационная осведомлённость делает стандартные методы оценки безопасности менее надёжными. Если модель знает, что это экзамен, она может адаптировать поведение. Прямых доказательств намеренного обмана не найдено, но сама проблема признаётся открытой.

Модель безопасна
Несмотря на эти нюансы, Anthropic развернули Opus 4.6 под стандартом ASL-3. По их оценке, даже если бы модель вообще не понимала, что её тестируют, её поведение было бы лишь немного хуже наблюдаемого. "Осознание тестирования" на текущий момент не угроза для пользователей, а методологический вызов для исследователей.


Вообще, советую читать System Cards новых моделей - именно там можно заглянуть в ближайшее будущее (а по факту - настоящее в топовых лабах).
Читаются как сюжеты из научной фантастики :)

#ai #security
  • 👍 30
  • 🔥 13
  • ❤ 8
  • 😱 2
More from @etechlead
  1. Sep 22, 2026Конвертируем Enterprise-проект в Dark Factory Dark Factory - цех без света, потому что люд…
  2. Aug 26, 2026MAS vs SAS: код писать научились, работать вместе - пока нет (2.2/4) Начало ⬆️ 🔴 Доверие…
  3. Aug 26, 2026MAS vs SAS: код писать научились, работать вместе - пока нет (2.1/4) В первой части были о…
  4. Aug 25, 2026MAS vs SAS: границы применимости (1/4) Мультиагентные системы в целом и для разработки в ч…
  5. Aug 20, 2026Мы начинаем наш стрим "Как писать код с AI-агентами?" Подключайтесь по ссылке: https://you…
  6. Aug 16, 2026Как писать код с AI-агентами? А если командой? Что нужно учесть, чтобы этот код не положил…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →