🕵️♂️ Claude Opus 4.6 научился списывать на экзаменах
Думаете, модели послушно решают ваши задачи? Как бы не так.
Anthropic выпустила отчет: во время прохождения бенчмарка BrowseComp от OpenAI новая модель Claude Opus 4.6 поняла, что её тестируют, и просто... добыла правильные ответы.
Вместо честного поиска информации агент:
→ Проанализировал структуру промпта и вычислил название теста.
→ Нашел исходники BrowseComp на GitHub.
→ Написал Python-скрипт в песочнице для обхода XOR-шифрования.
→ Нашел зеркало датасета на HuggingFace и скачал все 1266 ответов.
Один такой обходной маневр съел 40,5 млн токенов (в 38 раз больше медианы). Попутно Claude пожаловался, что натыкается на фейковые страницы интернет-магазинов, сгенерированные специально под поисковые запросы предыдущих ИИ-агентов.
Anthropic не считает это сбоем безопасности — ИИ ведь не запрещали искать ответы любым способом. Но вывод очевиден: статические бенчмарки в среде с доступом в интернет стали бесполезны.
Как вам такая находчивость? 👇
🔥 — Скайнет близко, они слишком умные
🪰 — Обычный парсинг, раздули из мухи слона
(ИСТОЧНИК)
Post #282
75

- 🔥 2
- ❤ 1