Ранее в сентябре OpenAI представила флагманскую GPT-6 Astra, а теперь дополнила семейство двумя более быстрыми и дешёвыми моделями. По словам компании, Sol и Luna обучены теми же методами, что и Astra. Цель в том, чтобы перенести её сильные стороны в профессиональных задачах, фактической точности, программировании и управлении компьютером на более доступный ценовой уровень. Astra при этом остаётся самой способной моделью линейки.
Цены
По сравнению с промо-тарифами GPT-5.6 цены заметно снижены. Sol стоит $2 за миллион входных токенов и $10 за миллион выходных, то есть ровно вдвое дешевле предшественницы. Luna обходится в $0,10 на входе и $0,50 на выходе: входные токены подешевели вдвое, выходные примерно на 58%. Снижение OpenAI объясняет оптимизацией инференса и кэширования.
Результаты на бенчмарках
Все цифры ниже приводит сама OpenAI. В AutomationBench агенты выполняют бизнес-процессы с помощью 47 инструментов из разных приложений. Там Sol на уровне рассуждений xhigh набирает 33,2%. Это больше, чем у Claude Opus 5 в режиме max (26,9%) и даже у GPT-6 Astra на низком уровне (30,3%), причём одна задача обходится примерно в 11 раз дешевле, чем у Opus 5.
DeepSWE 1.1 проверяет сложную разработку в реальных кодовых базах. Sol в режиме max получает в нём 68,8%, всего на 1,1 п.п. меньше лучшего результата Claude Fable 5, при стоимости задачи примерно на 80% ниже. Luna в режиме max набирает там же 66,6%. Это сопоставимо с Opus 5 и Fable 5 на среднем уровне рассуждений, но на 93% и 96% дешевле соответственно.
В OSWorld 2.0, где оценивается работа с компьютером, Sol показывает 60,5% против 60,3% у Opus 5 в среднем режиме, снова примерно на 80% дешевле. На внутренней оценке фактической точности Sol ошибается примерно вдвое реже, чем GPT-5.6 Sol.
Стиль и выравнивание
Обе модели унаследовали от Astra обновлённую манеру общения: меньше жаргона, странных оборотов и малополезных подробностей, а ответы стали чуть короче без потери содержания. Во внутренних тестах на выравнивание Sol и Luna выступают лучше версий GPT-5.6. В частности, они реже делают вводящие в заблуждение заявления о проделанной работе с кодом. Компания подчёркивает, что эти тесты намеренно моделируют трудные ситуации и не отражают частоту сбоев при обычном использовании.
Кэширование для агентов
Для разработчиков OpenAI улучшила кэширование промптов. Доля попаданий в кэш по умолчанию выросла, а чтение закэшированных входных токенов оплачивается со скидкой 90%. Теперь посреди диалога можно менять уровень рассуждений, а также включать и отключать инструменты, не сбрасывая кэш. Явные точки разбиения позволяют самому задать, где заканчивается кэшируемый префикс. Появились также дашборд и инструмент диагностики, который объясняет, почему кэш не сработал. GitHub сообщает, что за последние месяцы эти улучшения более чем вдвое сократили в Copilot долю промпт-токенов, которые приходится обрабатывать заново.
Доступность
С сегодняшнего дня модели постепенно появляются в ChatGPT Work и Codex для подписчиков Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go получают доступ к Luna в десктопном приложении. В режиме Chat модели пока недоступны. В API они доступны под идентификаторами
gpt-6-sol и gpt-6-luna.
