Протестировал GPT-5.6 Sol на Ultra/Max/Xhigh/High/Medium/Low
Если нет разницы, то зачем переплачивать?
Ultra - 33m 40s total=229 821 input=171 469 (+ 8 340 736 cached) output=58 352 (reasoning 30 812)
Max - 17m 40s Token usage: total=398 409 input=329 360 (+ 3 955 456 cached) output=69 049 (reasoning 32 033)
Xhigh - 12m 25s Token usage: total=153 162 input=110 146 (+ 2 328 832 cached) output=43 016 (reasoning 12 990)
High - 12m 03s Token usage: total=133 041 input=92 581 (+ 1 727 488 cached) output=40 460 (reasoning 10 871)
Medium - 5m 59s Token usage: total=83 928 input=62 421 (+ 917 760 cached) output=21 507 (reasoning 3 518)
Low - 6m 39s Token usage: total=93 440 input=71 195 (+ 1 263 872 cached) output=22 245 (reasoning 1 569)
Такие мощные модели, как GPT-5.6 уже делают все довольно ровно и эстетично (даже без проверки в браузере), но у некоторых аппаратов кнопка отмены налазит на кнопки навигации, и видны какие-то мелкие дефекты. Так же иногда появляется какой-то артефактный текст "Back to 2000", которого нет в промпте.
Как видим, low модель уже делает 6 кнопок навигации вместо 4. Точка перелома наступает после medium:
Low-Medium - по 6 минут.
High-Xhigh - по 12 минут (уже в два раза дольше).
Max - 17 мин. (его можно выбрать только в CLI версии).
Ultra - 33 мин (для таких задач его лучше не выбирать, это избыточно).
Так же в low версии не появляется надпись Game Over, хотя игра корректно завершается (остальные не тестировал)
Любопытно:
• Производитель по умолчанию ставит thinking на Low.
• Медиум работает даже быстрее, чем Low 5m 59s против 6m 39s
Вывод:
Но, все не точно, это уж как повезет, все тесты выполнены в один прогон и хорошо было бы каждую модель раз по 5 прогнать, чтобы сделать выводы во вариации потребления токенов (с каждый прогном оно не одинаково).
Практика показывает, что thinking low у OpenAI - это ну полный мусор, и выбирать его вообще не ясно для чего (если есть GPT-5.4-mini), а вот к Medium стоит присмотреться (и устроить ему более пристальное тестирование).
Лимитов на эти тесты тоже уходит прилично, где-то 50% от 5ти часового лимита, и 7% от недельного лимита за 5 аппаратов.
Post #1524
678





- 👍 2