все последние анонсы про нейронные сети сопровождаются результатами бенчмарков, в частности terminal-bench-science (упомянут во всех анонсах fable 5.1, которые я видела). наверняка вы знаете, что такое бенчмарк, но мне кажется, круто было бы обсудить, какие из них самые важные, а на какие ориентируются в основном нишевые специалисты.
основная проблема современных в том, что они перестали быть измерительными приборами. это стало системной болезнью индустрии, и имя ей 'насыщение'.
самый яркий пример — swe-bench verified, который до 2026 года считался золотым стандартом для оценки способности нейросеточек писать код. в 2023-м, если вы помните, сильнейшие модели решали 3% задач. к 2026-му топы выжимают уже 93.9% и вот и в феврале openai уже отказалась от использования этого теста, потому что он ничего не показывает.
на примере разбираем причины устаревания бенчмарков:
контаминация: задачи swe-bench взяты из открытых python-репозиториев на github, на которых модели и учились, а когда каждая модель может воспроизвести эталонный патч дословно (по идентификатору задачи) это не имеет смысла.
дефектные тесты: из 138 задач, с которыми модели не справлялись в 59.4% содержались критические ошибки, а 35.5% были слишком узки и требовали конкретной реализации, а еще 18.8% проверяли поведение, которого нет в условии, в общем, даже у корректных решений не было шанса пройти тест.
saturation: все модели пишут 90%+, тест перестаёт их разделять. непонятно, кто лучше.
на смену verified пришёл swe-bench pro и 1865 задач из 41 репозитория, часть из которых взята из закрытых кодовых баз стартапов и не попадала в обучающие данные. разрыв огромный: open source модель qwen3.8-27b показывает 61.7%, в то время как на verified у неё было бы >90%.
какие еще бенчмарки круто знать?
humanity's last exam (hle): в 2025-м модели набирали здесь 8.8%, в августе 2026-го claude opus 5 ведёт с 64.7% + этот тест пока не насыщен и действительно разделяет модели, но есть нюанс: разные компании разрешают разный набор инструментов — кто-то с веб-поиском, кто-то без, что делает прямое сравнение не вполне корректным.
arc-agi-2: тест на абстрактное мышление. головоломки с сетками, где нужно понять принцип и дорисовать картинку. в нём нет текстовых инструкций — только примеры, что исключает заучивание и языковую предвзятость, человек решает 66% задач, а gpt-5.6 sol — 92.5%, обойдя claude opus 5 (90.4%), по крайней мере в августе.
terminal-bench 2.1: тест агентов в среде. модель заходит в настоящий терминал, компилирует код, настраивает сервер. qwen3.8-27b ведёт с 73.0%.
старые бенчмарки умерли, а новые бенчмарки перестают быть инструментами измерения, но пока мы не научимся измерять ии правильно, мы никогда не узнаем, когда он действительно станет умнее нас.
mediãi
Post #874
33
