Краткая сводка:
OpenAI выпустила GPT‑6 Sol и GPT‑6 Luna — более дешёвые и быстрые модели семейства GPT‑6. Их обучали теми же методами, что и флагманскую GPT‑6 Astra, представленную в начале месяца. Astra по-прежнему остаётся самой сильной моделью, а Sol и Luna рассчитаны на повседневную работу в больших объёмах.
Цены в API (за 1 млн токенов, вдвое ниже промо-цен GPT‑5.6):
- Sol: $2 за входные токены, $10 за выходные.
- Luna: $0.10 за входные токены, $0.50 за выходные.
Бенчмарки (сравнения с Claude от OpenAI):
- AutomationBench (бизнес-процессы в приложениях): Sol на xhigh набирает 33,2% и обходит Opus 5 на max (26,9%) при 9% его стоимости за задачу. Также он опережает Fable 5.1 и Astra на low.
- Agents' Last Exam (профессиональные задачи): Sol набирает 56,4%, это выше лучшего результата Opus 5, а задача обходится на 60% дешевле.
- DeepSWE (сложная разработка): Sol набирает 68,8% и отстаёт от Fable 5 (69,9%) на 1,1 п.п. при стоимости примерно на 80% ниже. Luna набирает 66,6%, как Opus 5 и Fable 5 на medium, и стоит на 93–96% дешевле.
- FrontierCode (готовность кода к мержу): Sol догоняет Fable 5.1 xhigh при меньшей цене.
- OSWorld 2.0 (управление компьютером): Sol набирает 60,5%, почти как Opus 5 на medium (60,3%), примерно на 80% дешевле.
- Фактические ошибки: у Sol их вдвое меньше, чем у предшественника. Luna на высоком effort держится на уровне GPT‑5.6 Sol примерно за сотую часть цены.
Прочее:
- Стиль ответов: модели переняли стиль Astra, поэтому отвечают яснее и немного короче, меньше используют жаргон и чаще прямо пишут, что проверили, а что нет.
- Кэширование: доля попаданий в кэш выросла, а на кэшированный вход действует скидка 90%. Появились дашборд и диагностика кэша, явные точки разреза кэшируемого префикса (breakpoints), а смена reasoning effort и набора инструментов больше не сбрасывает кэш.
- Alignment: в стресс-тестах обе модели лучше версий GPT‑5.6, в том числе реже вводят в заблуждение насчёт выполненной работы по коду.
Доступность: модели уже есть в ChatGPT Work и Codex для Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go получают Luna в десктопном приложении. В обычном Chat моделей пока нет. В API они называются gpt-6-sol и gpt-6-luna. Выкатка идёт постепенно в течение дня.
А в бенчмарки новый Opus 5.5 не добавили, везде сравнивают с пятым xD
https://openai.com/index/introducing-gpt-6-sol-and-luna
