TGViewer
Vibe Coding: OpenCode, Claude Code, Codex, Cursor, Kilo Vibe Coding: OpenCode, Claude Code, Codex, Cursor, Kilo @prog_ai · 4.49K subscribers
Post #1524 678
Протестировал GPT-5.6 Sol на Ultra/Max/Xhigh/High/Medium/Low

Если нет разницы, то зачем переплачивать?

Ultra - 33m 40s total=229 821 input=171 469 (+ 8 340 736 cached) output=58 352 (reasoning 30 812)

Max - 17m 40s Token usage: total=398 409 input=329 360 (+ 3 955 456 cached) output=69 049 (reasoning 32 033)

Xhigh - 12m 25s Token usage: total=153 162 input=110 146 (+ 2 328 832 cached) output=43 016 (reasoning 12 990)

High - 12m 03s Token usage: total=133 041 input=92 581 (+ 1 727 488 cached) output=40 460 (reasoning 10 871)

Medium - 5m 59s Token usage: total=83 928 input=62 421 (+ 917 760 cached) output=21 507 (reasoning 3 518)

Low - 6m 39s Token usage: total=93 440 input=71 195 (+ 1 263 872 cached) output=22 245 (reasoning 1 569)

Такие мощные модели, как GPT-5.6 уже делают все довольно ровно и эстетично (даже без проверки в браузере), но у некоторых аппаратов кнопка отмены налазит на кнопки навигации, и видны какие-то мелкие дефекты. Так же иногда появляется какой-то артефактный текст "Back to 2000", которого нет в промпте.

Как видим, low модель уже делает 6 кнопок навигации вместо 4. Точка перелома наступает после medium:

Low-Medium - по 6 минут.
High-Xhigh - по 12 минут (уже в два раза дольше).
Max - 17 мин. (его можно выбрать только в CLI версии).
Ultra - 33 мин (для таких задач его лучше не выбирать, это избыточно).

Так же в low версии не появляется надпись Game Over, хотя игра корректно завершается (остальные не тестировал)

Любопытно:
• Производитель по умолчанию ставит thinking на Low.
• Медиум работает даже быстрее, чем Low 5m 59s против 6m 39s

Вывод:

Но, все не точно, это уж как повезет, все тесты выполнены в один прогон и хорошо было бы каждую модель раз по 5 прогнать, чтобы сделать выводы во вариации потребления токенов (с каждый прогном оно не одинаково).

Практика показывает, что thinking low у OpenAI - это ну полный мусор, и выбирать его вообще не ясно для чего (если есть GPT-5.4-mini), а вот к Medium стоит присмотреться (и устроить ему более пристальное тестирование).

Лимитов на эти тесты тоже уходит прилично, где-то 50% от 5ти часового лимита, и 7% от недельного лимита за 5 аппаратов.
  • 👍 2
More from @prog_ai
  1. Sep 27, 2026Клод Код научили корректного завершать сессии При выполнении задачи при окончании 5ч квот…
  2. Sep 27, 2026Поздравляем Гугл с 28 днем рождения
  3. Sep 27, 2026Что тогда можно навабокодить за 1-2 дня? Получил вот такие ответы от ЛЛМ: • Погодного бота…
  4. Sep 27, 2026ВСЕМ ПРИВЕТ. МЕНЯ ЗОВУТ АНДРЕЙ, И Я ВАЙБКОГОЛИК. Вчера кончились лимиты сразу в Клоде и в…
  5. Sep 27, 2026Давно хотел протестировать эту функцию отправки сообщения из одного КК в другой (показал н…
  6. Sep 26, 2026Ну что ребята, флешмоб Тибо Not a good look Ты обещал и где ресет? Единственное, что в США…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →