TGViewer
AI[ex]Time AI[ex]Time @aiextime · 2.83K subscribers
Post #145 2.41K
А так, помимо того, что сказано в посте выше, добавлю еще несколько моментов:

1. Максимальный Pass@5 у моделей 31/52 (59.6%), но если посмотреть на общее число хоть раз решенных задач по всем, то там будет уже 37. То есть даже для топовых моделей есть непересекающееся множество задач, которые они решить не могут, но решают конкуренты.
2. Из опенсурс моделей только GLM4.5 и Qwen3-Coder-480B навязывает конкуренцию фронтирным.
3. Grok Code Fast имеет поразительный уровень Resolved Rate за свою цену, весь прогон на 5 ранов на 52 задачах занял 14 долларов.

Через неделю планируем закинуть тройку новых интересных моделей, попробуйте угадать какие 🙂
  • ❤ 10
More from @aiextime
  1. Aug 25, 2026Еще немного интересных наблюдений из RL для MoE. В нем есть одна проблема, которая делает…
  2. Jul 27, 2026Какое-то время назад открыл для себя, насколько CISPO робастнее к выбору гиперпараметров п…
  3. Jun 29, 2026На следующей неделе я буду на ICML, в том числе презентовать с командой постеры по несколь…
  4. Jun 11, 2026Только успели выкатить мини-релиз SWE-rebench с Gemini 3.5 Flash, MiniMax M3 и Junie (тепе…
  5. May 29, 2026По горячим следам добавили Opus 4.8 xhigh, картина теперь такая
  6. May 28, 2026SWE-rebench давно не обновлялся. Все потому, что каждый месяц прогонять новые модели, да е…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →