TGViewer
mediãi mediãi @media_ai · 1.04K subscribers
Post #874 33
все последние анонсы про нейронные сети сопровождаются результатами бенчмарков, в частности terminal-bench-science (упомянут во всех анонсах fable 5.1, которые я видела). наверняка вы знаете, что такое бенчмарк, но мне кажется, круто было бы обсудить, какие из них самые важные, а на какие ориентируются в основном нишевые специалисты.

основная проблема современных в том, что они перестали быть измерительными приборами. это стало системной болезнью индустрии, и имя ей 'насыщение'.



самый яркий пример — swe-bench verified, который до 2026 года считался золотым стандартом для оценки способности нейросеточек писать код. в 2023-м, если вы помните, сильнейшие модели решали 3% задач. к 2026-му топы выжимают уже 93.9% и вот и в феврале openai уже отказалась от использования этого теста, потому что он ничего не показывает.



на примере разбираем причины устаревания бенчмарков:

контаминация: задачи swe-bench взяты из открытых python-репозиториев на github, на которых модели и учились, а когда каждая модель может воспроизвести эталонный патч дословно (по идентификатору задачи) это не имеет смысла.

дефектные тесты: из 138 задач, с которыми модели не справлялись в 59.4% содержались критические ошибки, а 35.5% были слишком узки и требовали конкретной реализации, а еще 18.8% проверяли поведение, которого нет в условии, в общем, даже у корректных решений не было шанса пройти тест.

saturation: все модели пишут 90%+, тест перестаёт их разделять. непонятно, кто лучше.

на смену verified пришёл swe-bench pro и 1865 задач из 41 репозитория, часть из которых взята из закрытых кодовых баз стартапов и не попадала в обучающие данные. разрыв огромный: open source модель qwen3.8-27b показывает 61.7%, в то время как на verified у неё было бы >90%.



какие еще бенчмарки круто знать?

humanity's last exam (hle): в 2025-м модели набирали здесь 8.8%, в августе 2026-го claude opus 5 ведёт с 64.7% + этот тест пока не насыщен и действительно разделяет модели, но есть нюанс: разные компании разрешают разный набор инструментов — кто-то с веб-поиском, кто-то без, что делает прямое сравнение не вполне корректным.

arc-agi-2: тест на абстрактное мышление. головоломки с сетками, где нужно понять принцип и дорисовать картинку. в нём нет текстовых инструкций — только примеры, что исключает заучивание и языковую предвзятость, человек решает 66% задач, а gpt-5.6 sol — 92.5%, обойдя claude opus 5 (90.4%), по крайней мере в августе.

terminal-bench 2.1: тест агентов в среде. модель заходит в настоящий терминал, компилирует код, настраивает сервер. qwen3.8-27b ведёт с 73.0%.



старые бенчмарки умерли, а новые бенчмарки перестают быть инструментами измерения, но пока мы не научимся измерять ии правильно, мы никогда не узнаем, когда он действительно станет умнее нас.

mediãi
More from @media_ai
  1. Sep 22, 2026#дайджест вышел новый grok можно пользоваться через cursor, grok build и api. появился сни…
  2. Sep 18, 2026#дайджест chatgpt интегрировался в word правда, только к пользователям лицензионного micro…
  3. Sep 17, 2026если честно я начинаю последнее время испытывать какую-то ответственность за свои отношени…
  4. Sep 14, 2026#дайджест прошедшей недели: с выходом gigachat 3.5 reasoning сменился флагман сбера обещаю…
  5. Sep 10, 2026через месяц в фестивальный прокат выходит фильм 'искусственный'. ничто так меня не радует…
  6. Sep 7, 2026mediãi pinned a photo
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →