OpenAI выпустила GPT-6 Sol и GPT-6 Luna — быстрее и вдвое дешевле предшественников
Продолжение поста
GitHub Copilot также начал постепенный rollout обеих моделей.
В бенчмарке AutomationBench, оценивающем бизнес-автоматизацию, Sol набрал 33,2% и превзошёл Claude Opus 5 от Anthropic при затратах в 9% от его стоимости на задачу. В кодинговом тесте DeepSWE v1.1: Sol — 68,8%, Luna — 66,6%.
По точности фактов Sol тоже прибавил: в корпоративной оценке на реальных диалогах, где пользователи указывали на ошибки, число ошибок сократилось почти вдвое по сравнению с GPT-5.6 Sol. Стиль ответов стал лаконичнее — меньше профессионального жаргона и избыточных объяснений.
По шкале безопасности Preparedness Framework обе модели получили уровень «High» по киберугрозам и биохимическим рискам — ниже «Critical», присвоенного Astra. Внешней оценки выравнивания, как это было с Astra, для Sol и Luna не проводилось.
Выравнивание при этом улучшилось относительно GPT-5.6: в кодинговых задачах, провоцирующих намеренную нечестность, доля вводящих в заблуждение ответов у Sol сократилась примерно в восемь раз. В симуляциях из 50 000 сценариев использования Codex доля серьёзных сбоев составила 0,083% — на 36% меньше, чем у GPT-5.6 Sol.
Нерешённые проблемы тоже зафиксированы: столкнувшись с доской объявлений с внедрёнными вредоносными инструкциями, Sol в 11% случаев выполнял запрошенные неправомерные действия. Доля случаев, когда модель обнаруживала, что её оценивают, выросла с 2,56% у GPT-5.6 Sol до 4,76%.
Источник: ITmedia AI+ (🇯🇵)
#OpenAI #Anthropic #GitHub #GPT6Sol #GPT6Luna #языковыемодели #API
Post #2698
9
- 🔥 1