Claude Opus или GPT Sol?
Неправильный вопрос.
Но начнем немного издалека. Есть такая штука ARC-AGI-3. Это набор игр, в которых испытуемый ИИ должен победить. Правила не указаны, так что модельке придется додумать правила на ходу. Чем больше побед, тем больше баллов.
Обычный Claude Opus 5 набирает гордые 30%. А GPT Sol всего лишь 13%. И таки что, все бежим покупать Claude?
Не спешите.
—
NVidia взяла Opus 5 и засунула его в самописную агентскю систему AVO. Это типа Claude Code, но собраный у себя дома. В AVO входит агентская память, инструменты и всякое прочее. Есть даже агент-босс, который бьет цифровой палкой агента-исполнителя, чтобы тот быстрее работал.
Так вот, в рамках харнесса AVO та же модель Claude Opus 5 закрыла тест на все 100%!
И таки что, теперь-то бежим покупать Claude?
Нет, не спешите.
—
OpenAI вообще-то немного расстроились по поводу 13% и начали думать. Думали недолго, потому что в итоге изменили всего две вещи:
• Стали хранить reasoning модели между шагами, чтобы она запоминала правила
• Начали компактить длинный контекст.
И вуаля! Из 13% удалось выжать 38%. НА ТОЙ ЖЕ МОДЕЛИ.
И нет, бежать и покупать Opus не стоит. Дело вообще не в нем.
—
Все примеры выше вообще не про модели.
Эти примеры про обвязку вокруг модели. Харнесс. Он драматически влиял на и на успех работы модели, и на стоимость использования (потому что снижал кол-во output токенов, например).
А в реальном мире это работает?
Работает. Компания Databricks взяла и прогнала одинаковые модели через разные харнессы. Вот результаты, но одна и та же модель СИЛЬНО по-разному перформит на разном харнессе. Щелкните по ссылке, эта статья стоит ваших пяти минут.
Если вы прямо сейчас внедряете ИИ в вашу команду, вопрос Sol или Opus должен отходить на второй план и уступать место ключевому вопросу — что по харнессу? Где хранить контекст? Память? Тулзы?
Это, конечно, сильно сложнее, чем модельки выбирать.
Post #225
1.63K
- 👍 15
- ❤ 8
- 🔥 5