Цифры в официальных презентациях выглядят интересными. А что там с кодингом? И как оно на практике?
В релизном посте показали только один coding-бенчмарк – Elo-рейтинг для Codeforces Competition Code (ссылка). На нём всё выглядит хорошо: 120B может тягаться с проприетарными версиями o3 и o4-mini.
Я пошёл попробовать модель на открытом бенчмарке
Aider Polyglot (ссылка) – датасет из полуалгоритмических задач на разных языках (например, тут есть задача на реализацию команды grep, механика игры в боулинг или упрощенный вариант Excel). Плюс бенчмарка в том, что сетап очень простой, тестирует прикладную бизнес-логику (до какой-то степени), и всё можно быстро запустить для разных языков, быстро получив представление о модели. Датасет скорее служит sanity check, подтверждающим, что модель адекватна. Использую его для проверки всех моделей, с которыми работают и хорошо коррелирует с общими впечатлениями от использования того или иного решения.
Несколько запусков привели к удивительно низким цифрам – около 35 % при high reasoning в one-shot режиме. При этом на официальном лидерборде есть o3-pro (high) с 85 % точности и o4-mini с 55 %.
Наверное, я что-то делаю не так. Дошло, что стоит полистать model card модели (ссылка тут). Оказывается, авторы тоже делают замер на этом бенчмарке и получают сопоставимые результаты – 24 % при low, 44 % при high. Короче говоря, открытая модель значительно уступает в способности писать код даже в самых базовых ситуациях (очень понятные задачи, максимум несколько файлов), и нужен значительный файн-тюн, чтобы дотянуться до сопоставимых цифр с закрытыми моделями.
Но бенчмарк Aider – это ладно, он всё равно так или иначе искусственный.
Вот некоторая компания Brokk разрабатывает свой собственный бенчмарк, ориентированный на тестирование кодогенерации в реальных Java-проектах (Cassandra, Lucene, JGit). Авторы не раскрывают детали задач и то, как именно используют модели, но дают наглядную иллюстрацию того, насколько GPT-OSS уступает другим opensource-моделям (Qwen3Coder, DeepSeek V3) и тем более проприетарным.
Картинка к посту.
Если ожидания от GPT-5 такие, что это модель следующего поколения, то почему бы не выложить в руки сообщества действительно мощную проприетарную модель старого поколения, типа o4-mini?
Возможно, с прорывами всё не так просто. Но увидим вечером.
