OpenAI сделала нам рабочую лошадку
Ещё один релиз OpenAI — и первая реакция: что они там опять судорожно чинят? А потом смотришь на результат и стоимость GPT-6.1 Sol. Похоже, среди этой суеты и криков о конце OpenAI выпустили самую полезную модель за последние пару месяцев. Рабочую лошадку для Codex и Hermes.
Агенту ведь нужно не только ответить, но и прочитать файлы, найти ошибку, внести правку, запустить тесты. Если не получилось — зайти ещё раз. На этом «ещё раз» и набегает счёт.
Павел Гурын дал моделям два репозитория со 105 специально внесёнными ошибками. Задача — найти и исправить. При максимальных усилиях GPT-6 Astra получила оценку 45, потратив $33 на API. GPT-6.1 Sol — 44 при $6,56.
Один балл разницы. Примерно пятикратная разница в расходах на этот прогон.
Остальные результаты добавляют контекста: GPT-5.6 Sol — 43,5 за $95,35. Opus 5.5 — 41,7 за $58,53. Предыдущая GPT-6 Sol обходилась в $9,33, но набирала 29,3. Теперь у Sol почти результат Astra, а счёт меньше даже собственного предыдущего.
Это именно то, о чем говорил Тибо. Вы будете иметь меньше лимитов, но модели будут дешевле и быстрее достигать нужного вам результата и итоговые затраты будут ниже, чем неделю назад.
Я выбираю такой вариант.
В анонсе OpenAI у Sol 6.1 заявлен близкий к Astra уровень в коде, управлении компьютером и профессиональных задачах. Тарифы API за миллион токенов: $2 за вход, $10 за выход, $0,10 за кэшированный вход. Когда агент часами возится с репозиторием, эти цены участвуют в работе постоянно.
Astra и Opus оставим право удивлять блендерами и презентациями. Для ежедневного Codex и Hermes куда нужнее модель, которой можно поручить следующую задачу без раздумий, стоит ли она счёта, который принесёт официант в конце вечеринки. У GPT-6.1 Sol сейчас очень хорошие шансы занять это место.
Мой личный опыт за 24 часа: около 10 моих проектов наконец-то сдвинулись с мертвой точки. Чисто на Sol 6.1.
Ждите релизов 🔌
Post #561
195

- ❤ 4