TGViewer
max.sh max.sh @max_dot_sh · 3.27K subscribers
Post #141 2.58K
И немного про GPT-OSS. Шумиха после релиза утихла – можно теперь и попробовать модель.

Цифры в официальных презентациях выглядят интересными. А что там с кодингом? И как оно на практике?

В релизном посте показали только один coding-бенчмарк – Elo-рейтинг для Codeforces Competition Code (ссылка). На нём всё выглядит хорошо: 120B может тягаться с проприетарными версиями o3 и o4-mini.

Я пошёл попробовать модель на открытом бенчмарке Aider Polyglot (ссылка) – датасет из полуалгоритмических задач на разных языках (например, тут есть задача на реализацию команды grep, механика игры в боулинг или упрощенный вариант Excel).

Плюс бенчмарка в том, что сетап очень простой, тестирует прикладную бизнес-логику (до какой-то степени), и всё можно быстро запустить для разных языков, быстро получив представление о модели. Датасет скорее служит sanity check, подтверждающим, что модель адекватна. Использую его для проверки всех моделей, с которыми работают и хорошо коррелирует с общими впечатлениями от использования того или иного решения.

Несколько запусков привели к удивительно низким цифрам – около 35 % при high reasoning в one-shot режиме. При этом на официальном лидерборде есть o3-pro (high) с 85 % точности и o4-mini с 55 %.

Наверное, я что-то делаю не так. Дошло, что стоит полистать model card модели (ссылка тут). Оказывается, авторы тоже делают замер на этом бенчмарке и получают сопоставимые результаты – 24 % при low, 44 % при high. Короче говоря, открытая модель значительно уступает в способности писать код даже в самых базовых ситуациях (очень понятные задачи, максимум несколько файлов), и нужен значительный файн-тюн, чтобы дотянуться до сопоставимых цифр с закрытыми моделями.

Но бенчмарк Aider – это ладно, он всё равно так или иначе искусственный.

Вот некоторая компания Brokk разрабатывает свой собственный бенчмарк, ориентированный на тестирование кодогенерации в реальных Java-проектах (Cassandra, Lucene, JGit). Авторы не раскрывают детали задач и то, как именно используют модели, но дают наглядную иллюстрацию того, насколько GPT-OSS уступает другим opensource-моделям (Qwen3Coder, DeepSeek V3) и тем более проприетарным.

Картинка к посту.

Если ожидания от GPT-5 такие, что это модель следующего поколения, то почему бы не выложить в руки сообщества действительно мощную проприетарную модель старого поколения, типа o4-mini?

Возможно, с прорывами всё не так просто. Но увидим вечером.
  • 👍 11
  • 🔥 8
  • 🍓 7
  • ❤ 2
  • ⚡ 1
More from @max_dot_sh
  1. Sep 16, 2026Вышел из отпуска и сразу в лондонскую подземку. А тут снова ждет креативная it-шная реклам…
  2. Aug 30, 2026Post #230
  3. Aug 21, 2026По этикету, уходя из хорошего места - найди хорошую замену. Поэтому пост с вакансией Компа…
  4. Aug 17, 2026К слову о конкурсах. И почему в них круто участвовать. Расскажу свою историю. В 2018 году…
  5. Aug 12, 2026🏎 Пост для для любителей контестов. Цель конкурса: разработать систему, которая передает…
  6. Aug 10, 2026Небольшой анекдот-история, чтобы задать правильный ритм на неделю. А кому и настроение под…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →