OpenAI сегодня релизнули GPT-5.6 и это явно ответ на новую волну агентских моделей. По бенчам Sol выглядит очень сильно в кодинге и автономных задачах: 80 на Coding Agent Index, 72.7% на DeepSWE, 84.5% на CyberGym, а в Ultra mode до 91.9% на Terminal-Bench 2.1 и 92.2% на BrowseComp. Но не везде топ: на SWE-Bench Pro и ExploitBench впереди всё ещё Claude Mythos 5, а на HealthBench чуть выше Fable 5.
Теперь у OpenAI три версии модели: Sol для самых сложных задач, Terra как баланс цена/качество и Luna как дешёвый быстрый вариант. Контекст у всех до 1,050,000 токенов, ответ до 128,000 токенов. В API Sol стоит $5 за input и $30 за output на миллион токенов, Terra $2.50 и $15, Luna $1 и $6. Большие запросы выше 272K input будут считаться дороже.
Обновится Codex и появится Ultra mode - это режим, где модель гоняет несколько субагентов параллельно и собирает результат в один ответ, то есть ставка явно на большие проекты, длинный дебаг, ресёрч по кодовой базе и задачи, где один агент раньше быстро упирался.
https://openai.com/index/gpt-5-6/
ждём доступа и тестируем 👌
Post #8657
1.16K
Forwarded from Futuris (Anton)
