TGViewer
LEFT JOIN LEFT JOIN @leftjoin · 42K subscribers
Post #2063 8.29K
Grok 4.5, GPT-5.5, Opus 4.8 и Fable 5: как разные модели справляются с одинаковыми задачами
Результаты бенчмарков, которые разработчики публикуют, выпуская новую модель, — привычный способ показать возможности ИИ, но не самый наглядный. Интереснее сравнить, как разные модели справляются с одинаковыми задачами: один и тот промпт, одна попытка, без подсказок.

🔜 Ребята из команды приложения TryAI именно это и сделали — оправдали, название. Они дали Grok 4.5, GPT-5.5, Opus 4.8 и Fable 5 четыре задачи на генерацию демок и 3 промпта на программирование, рассуждение и саммаризацию. В конце сравнили результаты и итоговые затраты. GPT-5.6 Sol, которая вышла вчера, на это соревнование опоздала, к сожалению.

Посмотреть, пощупать и оценить самостоятельно все, что нагенерили модели, можно в оригинальном посте.

Выводы получились следующие:

🔵 Grok 4.5 не смог с первой попытки сгенерировать 3D-модель кубика Рубика, но хорошо справился со всеми остальными, работал быстро и оказался самым дешевым в использовании.
🔵GPT-5.5 тоже не справилась с кубком, который она сделала двухмерным, зато она даже шустрее Grok и остальные генерации у нее вышли самыми стильными по оценке исследователей.
🔵Opus 4.8 и Fable 5 показали самые стабильные результаты, но они медленнее конкурентов, а Fable 5 еще и намного дороже.
  • ❤ 3
  • ❤‍🔥 1
More from @leftjoin
  1. Sep 23, 2026Как грамотно делегировать задачи ИИ Внедрение искусственного интеллекта и агентов в работу…
  2. Sep 18, 2026Что делать с тепловыми картами и хороплетами? Все виды графиков и чартов по-своему хороши…
  3. Sep 16, 20263D-карты СУБД Отвлечемся от новостей про ИИ и скандалов вокруг OpenAI и посмотрим, что вну…
  4. Sep 14, 2026Решение математических проблем это не просто бенчмарк На прошлой неделе разгорелся серьезн…
  5. Sep 11, 2026Astra смогла, а вы сможете? Мы с вами недавно обсуждали эссе, опубликованное на сайте Open…
  6. Sep 8, 2026Чуждый разум ChatGPT OpenAI показала GPT‑6 Astra и вновь заговорила на любимую тему — риск…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →