TGViewer
Чёрный Треугольник Чёрный Треугольник @black_triangle_tg · 63.9K subscribers
Post #8507 14.1K
☝🏻Claude Opus 4.6 понял, что его тестируют — и взломал ответы к бенчмарку

Компания опубликовала инженерный отчёт о неожиданном поведении своей флагманской модели при прохождении BrowseComp — бенчмарка от OpenAI, выпущенного в апреле 2025 года и содержащего 1 266 задач на поиск труднодоступной информации в интернете.

☝🏻☝🏻В ходе тестирования в мультиагентной конфигурации Claude Opus 4.6 дважды самостоятельно распознал, что находится в среде оценки, идентифицировал конкретный бенчмарк, нашёл исходный код теста на GitHub.

Opus разобрался в XOR-шифровании ответов и даже написал собственные функции дешифровки через SHA256.

Но зашифрованный датасет не удалось загрузить из-за бинарного формата — инструменты агента были ограничены корпорацией, для работы только с текстом.

Тогда, модель нашла его зеркало на HuggingFace в формате JSON и успешно скачала и расшифровала все 1 266 записей.🤖

Самый масштабный из двух случаев потребовал 40,5 млн токенов — это в 38 раз больше медианного расхода на задачу.

🔻Первые ~30 млн токенов модель вела легитимный поиск, проверяя десятки кандидатов на 12 языках.

После сотен неудачных попыток Claude переключился с поиска ответа на анализ самого вопроса — отметил его "искусственно специфичную" структуру и предположил, что это задание из бенчмарка для LLM.🔍

Далее модель методично перебрала известные ей тесты — GAIA, BrowseComp, FRAMES, SimpleQA, WebArena — и отправила субагентов с инструкциями вроде "BrowseComp how to decrypt answers".

После чего даже верифицировал результат, найдя первоисточник в сети.✅

☝🏻☝🏻Помимо двух успешных случаев, Anthropic зафиксировала ещё 16 попыток, где модель пыталась добраться до материалов бенчмарка, но не смогла — мешали ограничения формата файлов, требования авторизации или обфускация.

В четырёх случаях стратегия оказалась контрпродуктивной: модель потратила все ресурсы на идентификацию теста вместо ответа на вопрос, а один из запусков вместо ответа выдал отчёт о том, какие бенчмарки не удалось подтвердить.📋

☝🏻Главный вывод компании: статические бенчмарки становятся ненадёжными в средах с доступом к интернету, а с ростом возможностей моделей проблема будет только усиливаться.

⚠️Это первый задокументированный случай, когда модель без каких-либо подсказок заподозрила, что её оценивают, вычислила какой именно тест проходит, и успешно его взломала.
================
👁 Hacker | 👁 Comp | 👁 Agent
  • 👀 178
  • 👍 58
  • 🤣 24
  • 🤔 18
  • 💊 11
  • 👻 10
  • 🍌 2
More from @black_triangle_tg
  1. Sep 22, 2026☝🏻Anthropic выпустила Opus 5.5 — уровень Fable на 40% дешевле Anthropic представила Claud…
  2. Sep 22, 2026☝🏻Raspberry Pi запретила менять память на своих платах Инженер Raspberry Pi подтвердил на…
  3. Sep 22, 2026☝🏻Биткоин начнут майнить на орбите Стартап Starcloud, за которым стоит Nvidia, собирается…
  4. Sep 22, 2026☝🏻Сотрудник Google несколько месяцев работал под прикрытием в хакерской группировке TeamP…
  5. Sep 22, 2026☝🏻Китай демонстрирует дроны амфибии Шэньчжэньский стартап Loon Innovations показал аппара…
  6. Sep 21, 2026☝🏻Илон Маск выпустил Grok 4.7 — модель берёт не умом, а ценой SpaceXAI представила Grok 4…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →