OpenAI выпустила GPT-6.1 Sol — почти уровень Astra за пятую часть цены
Всего через неделю после выхода GPT-6 Sol OpenAI представила GPT-6.1 Sol. Новая модель практически догоняет флагманскую GPT-6 Astra в программировании, работе с компьютером и профессиональных агентных задачах.
На DeepSWE 1.1, где агентам нужно выполнять длинные задачи в реальных кодовых базах, GPT-6.1 Sol сравнялась с GPT-6 Astra и превзошла лучший результат предыдущего Sol на 6,4 процентного пункта, причём при меньших затратах на рассуждение. На OSWorld 2.0, проверяющем управление приложениями и компьютером, новая версия прибавила семь пунктов и приблизилась к Astra на 2,1 пункта, обходясь примерно в семь раз дешевле на одну задачу.
Особенно большой скачок OpenAI показывает на научных задачах. В Terminal-Bench Science, где модель анализирует данные, запускает симуляции и решает задачи с использованием кода и терминала, GPT-6.1 Sol более чем вдвое улучшила результат GPT-6 Sol. При максимальном уровне рассуждений одна задача обходилась в среднем в $5,47 против $23,80 у Astra. При этом сама Astra всё ещё остаётся сильнее и набрала 68,1%, поэтому OpenAI рекомендует её для наиболее сложных исследовательских задач.
Цена обычного ввода и вывода при этом осталась на уровне GPT-6 Sol: $2 за миллион входных и $10 за миллион выходных токенов. Кэшированный ввод подешевел вдвое — с $0,20 до $0,10 за миллион токенов. В сравнении с Astra, которая стоит $10/$50 за миллион входных/выходных токенов, новая модель действительно обходится примерно в пять раз дешевле.
В системной карточке OpenAI отмечает и улучшения в следовании ограничениям и намерениям пользователя. При этом по собственной системе Preparedness Framework компания относит GPT-6.1 Sol к уровню Critical по кибервозможностям и High по биологическим и химическим возможностям, поэтому для неё используется тот же набор защитных механизмов, что и для GPT-6 Astra.
GPT-6.1 Sol уже доступна в ChatGPT Work и Codex подписчикам Plus, Pro, Business, Enterprise и Edu, а через API — под именем "gpt-6.1-sol". В ближайшие дни OpenAI также обещает режим Ultrafast с генерацией до восьми раз быстрее стандартной скорости в Codex.
Post #1365
211