TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5557 8.56K
GPT-5.6 решил кубик за 17 секунд, а DeepSeek потратил 27 млн токенов за $0,56

Четырём топовым моделям дали необычный агентный тест: самостоятельно построить в Three.js интерактивные стенды для кубика Рубика и шахмат, а затем выполнить задания прямо внутри созданных приложений.

В эксперименте участвовали:

- GPT-5.6 Sol;
- DeepSeek V4 Flash 0731;
- Qwen 3.8 Max;
- Kimi K3.

Сначала модели получили одинаковую комбинацию кубика Рубика.

GPT-5.6 Sol решил её за 24 хода и 17 секунд.
DeepSeek справился за 32 хода.
Qwen сдался после 96 ходов, а Kimi - после 207.

Затем каждая модель построила шахматную доску и сыграла белыми против Claude Opus 5 без движка, дебютной базы и подсказок.

Победить Claude не смог никто:

- DeepSeek сдался на 13-м ходу;
- GPT-5.6 Sol - на 19-м;
- Kimi K3 - на 21-м;
- Qwen продержался до 29-го.

По скорости разработки GPT-5.6 разгромил остальных:


GPT-5.6 Sol 16 мин 43 сек
DeepSeek 97 мин 39 сек
Kimi K3 166 мин 09 сек
Qwen 3.8 Max 215 мин 08 сек

Стоимость:

DeepSeek использовал больше всех токенов: 27,4 млн и пять попыток на создание рабочих стендов. Несмотря на это, весь эксперимент обошёлся всего в $0,557.

Для сравнения:


DeepSeek $0,557
GPT-5.6 Sol $6,319
Qwen 3.8 Max $10,270
Kimi K3 $16,667


Получились четыре совершенно разных профиля:

- GPT-5.6 Sol - самый быстрый и экономный по токенам, но пропустил баг, из-за которого при взятии исчезала не та фигура;
- DeepSeek - часто ошибается с первой попытки, зато может повторять снова и снова почти бесплатно;
- Qwen - самый медленный, но показал наиболее аккуратную шахматную игру;
- Kimi - активно проверял собственные результаты, но оказался самым дорогим и не справился с кубиком.


Иногда важнее получить результат за 17 минут. Иногда - иметь возможность сделать пять попыток за полдоллара.

Важно: это авторский эксперимент в Hermes Agent CLI, а не стандартизированный независимый бенчмарк.
  • 👍 40
  • ❤ 16
  • 🔥 10
More from @data_analysis_ml
  1. Sep 25, 2026Opus 5.5 пишет код, Fable подсказывает: в Claude Code появился советник Если основная моде…
  2. Sep 25, 2026Xiaomi MiMo-V2.6-Pro вышла в лидеры среди моделей с открытыми весами по индексу Artificial…
  3. Sep 25, 2026🤖 Как AI может работать с данными из 1С — и что для этого действительно нужно? 1 октября…
  4. Sep 25, 2026🔥 DeepSeek Harness получил официальную desktop-версию Теперь DeepSeek Harness можно запус…
  5. Sep 25, 2026🧹 Opus 5.5 пора избавить от «магии промптов» Разработчик Anthropic поделился полезным при…
  6. Sep 24, 2026Google планирует запустить первый ИИ-спутник Project Suncatcher 1 октября Аппарат отправит…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →