Grok 4.5, GPT-5.5, Opus 4.8 и Fable 5: как разные модели справляются с одинаковыми задачами
Результаты бенчмарков, которые разработчики публикуют, выпуская новую модель, — привычный способ показать возможности ИИ, но не самый наглядный. Интереснее сравнить, как разные модели справляются с одинаковыми задачами: один и тот промпт, одна попытка, без подсказок.
🔜 Ребята из команды приложения TryAI именно это и сделали — оправдали, название. Они дали Grok 4.5, GPT-5.5, Opus 4.8 и Fable 5 четыре задачи на генерацию демок и 3 промпта на программирование, рассуждение и саммаризацию. В конце сравнили результаты и итоговые затраты. GPT-5.6 Sol, которая вышла вчера, на это соревнование опоздала, к сожалению.
Посмотреть, пощупать и оценить самостоятельно все, что нагенерили модели, можно в оригинальном посте.
Выводы получились следующие:
🔵 Grok 4.5 не смог с первой попытки сгенерировать 3D-модель кубика Рубика, но хорошо справился со всеми остальными, работал быстро и оказался самым дешевым в использовании.
🔵GPT-5.5 тоже не справилась с кубком, который она сделала двухмерным, зато она даже шустрее Grok и остальные генерации у нее вышли самыми стильными по оценке исследователей.
🔵Opus 4.8 и Fable 5 показали самые стабильные результаты, но они медленнее конкурентов, а Fable 5 еще и намного дороже.
Post #2063
8.29K
- ❤ 3
- ❤🔥 1