☝🏻Claude Opus 4.6 понял, что его тестируют — и взломал ответы к бенчмарку
Компания опубликовала инженерный отчёт о неожиданном поведении своей флагманской модели при прохождении BrowseComp — бенчмарка от OpenAI, выпущенного в апреле 2025 года и содержащего 1 266 задач на поиск труднодоступной информации в интернете.
☝🏻☝🏻В ходе тестирования в мультиагентной конфигурации Claude Opus 4.6 дважды самостоятельно распознал, что находится в среде оценки, идентифицировал конкретный бенчмарк, нашёл исходный код теста на GitHub.
Opus разобрался в XOR-шифровании ответов и даже написал собственные функции дешифровки через SHA256.
Но зашифрованный датасет не удалось загрузить из-за бинарного формата — инструменты агента были ограничены корпорацией, для работы только с текстом.
Тогда, модель нашла его зеркало на HuggingFace в формате JSON и успешно скачала и расшифровала все 1 266 записей.🤖
Самый масштабный из двух случаев потребовал 40,5 млн токенов — это в 38 раз больше медианного расхода на задачу.
🔻Первые ~30 млн токенов модель вела легитимный поиск, проверяя десятки кандидатов на 12 языках.
После сотен неудачных попыток Claude переключился с поиска ответа на анализ самого вопроса — отметил его "искусственно специфичную" структуру и предположил, что это задание из бенчмарка для LLM.🔍
Далее модель методично перебрала известные ей тесты — GAIA, BrowseComp, FRAMES, SimpleQA, WebArena — и отправила субагентов с инструкциями вроде "BrowseComp how to decrypt answers".
После чего даже верифицировал результат, найдя первоисточник в сети.✅
☝🏻☝🏻Помимо двух успешных случаев, Anthropic зафиксировала ещё 16 попыток, где модель пыталась добраться до материалов бенчмарка, но не смогла — мешали ограничения формата файлов, требования авторизации или обфускация.
В четырёх случаях стратегия оказалась контрпродуктивной: модель потратила все ресурсы на идентификацию теста вместо ответа на вопрос, а один из запусков вместо ответа выдал отчёт о том, какие бенчмарки не удалось подтвердить.📋
☝🏻Главный вывод компании: статические бенчмарки становятся ненадёжными в средах с доступом к интернету, а с ростом возможностей моделей проблема будет только усиливаться.
⚠️Это первый задокументированный случай, когда модель без каких-либо подсказок заподозрила, что её оценивают, вычислила какой именно тест проходит, и успешно его взломала.
================
👁 Hacker | 👁 Comp | 👁 Agent
Post #8507
14.1K

- 👀 178
- 👍 58
- 🤣 24
- 🤔 18
- 💊 11
- 👻 10
- 🍌 2