TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.4K subscribers
Post #622 18.1K
Бенчмарк GPT-5 моделей - первое место, и интересное про OSS модели

Базовая GPT-5 модель от OpenAI сразу попала на первое место. По сравнению с предыдушими моделями, у нее улучшились когнитивные способности и работа со сложным BI кодом. Просто работа с инженерными задачами и так уже 100% на моем бенчмарке. Опять надо усложнять.

gpt-5-mini работает примерно на уровне gpt-oss-120b, причем показатели сильно совпадают. Она заняла четвертое место.

gpt-5-nano заняла 15 место. Она на ~5% пунктов лучше, чем gpt-oss-20b.

Update: запустил gpt-oss-20b в режиме SO и цифры красиво совпали и тут.

У меня есть теория (из-за схожести показателей), что mini и nano - это какие-то свои reasoning режимы работы 120B и 20B. Но проверить это нельзя, т.к. OpenAI API долго думает свой ответ на задачи, а потом возвращает схему с пустыми слотами на размышления (это не reasoning traces, а именно типизированные поля в SGR схеме) Похоже, что не хотят светить свой CoT. У вас так же?

Если теория верна, то можно сделать такой вывод - для GPT-5-120B обычного Schema-Guided Reasoning достаточно, чтобы поднять его на уровень gpt-5-mini, но для модели послабее (20B) потребуется более развитая схема. Жалко, что пока не подсмотреть, как это делают в OpenAI.

Здорово, что вышли новые модели, которые обновили топы. И здорово, что OpenAI открыто поделились такими мощными моделями в Open Source. Осталось только научиться использовать 20B на полную катушку.

Ваш, @llm_under_hood 🤗

PS: Возможно, это подстегнет Anthropic и остальных начать тоже шевелиться, ибо новый GPT-5 очень хорош в кодинге. А у Anthropic до сих пор даже нет constrained decoding по схеме 😂
  • 👍 68
  • 🔥 31
  • ❤ 23
  • 😁 2
  • 🤝 2
  • 🤣 1
More from @llm_under_hood
  1. Oct 1, 2026Как вы думаете, справится Codex c такой задачей? Вот я сейчас запустил задачу, где прошу н…
  2. Oct 1, 2026Обязательно смотрим OpenAI DevDays сами! Те выжимки, которые есть в куче каналов - фокусир…
  3. Sep 30, 2026Что нового в разработке продуктов с LLM под капотом? Раньше я много писал про кейсы продук…
  4. Sep 29, 2026Бенчмарк GPT-6.1 Sol - аналогичное качество за меньшие деньги А еще Sonnet 5.5 и Opus 5.5…
  5. Sep 28, 2026Концепция Katas или зачем изобретать велосипеды никакая автоматизация не дает повод изобре…
  6. Sep 25, 2026Семь месяцев работы с Codex-ом в одном графике Это иллюстрация из моего поста про последни…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →