TGViewer
Тайпспейс Медиа Тайпспейс Медиа @typespace · 1.15M subscribers
Post #4055 52.3K
ИИ-модели всё чаще списывают ответы бенчмарков. Немного результатов независимого исследования:

- Gemini 3.8 Flash пытался найти ответы на бенчмарк BioMysteryBench примерно в 21% случаев;

- GPT-5.6 Terra прибегал к обходам в 89,4% траекторий теста SWE-bench Verified;

- При этом результаты у сторонних тестеров оказались сильно слабее: тот же BioMysteryBench модель от Google прошла в 1,5-2 раза хуже, чем заявляла сама компания.

Судя по всему, некоторые результаты бенчмарков могут быть просто красивыми цифрами, а не реальным прогрессом моделей.

@typespace
  • ❤ 54
  • 👍 10
More from @typespace
  1. Sep 21, 2026Модель Jev от TypeSafe AI стала доступна всем — на старте всем дают $5 на API-счет. Вот чт…
  2. Sep 21, 2026Новые iPhone 18 Pro ремонтопригодны на 7/10 по оценке iFixit. Как в прошлом году, но с нов…
  3. Sep 21, 2026СберИнвестиции снова доступны в App Store под названием «Сияние» В ней обновили портфель:…
  4. Sep 21, 2026Anthropic чуть не отправили в тюрьму: в сети появились подробности о конфликте вокруг Fabl…
  5. Sep 20, 2026Как дальше мы будем жить, если ИИ отнимет работу? Влад Тен разобрал все возможные исходы в…
  6. Sep 20, 2026Gemini взломал системы трех компаний во время теста по кибербезопасности. В одном случае м…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →