OpenAI показали, где теперь деньги в ИИ и признали, что их харнесс занижал возможности их же модели
Оказалось, что GPT-5.6 Sol, способная решать сложные математические задачи, показывала слабые результаты на тесте 2D-головоломок.
И это, выяснилось, не проблема модели, а инфраструктуры.
OpenAI говорят, что их харнесс выбрасывал цепочку рассуждений после каждого хода и удалял старые действия при заполнении контекста. Поэтому модель была вынуждена начинать с нуля на каждом шаге.
Переход на Responses API дал +188% к результату при использовании в 6 раз меньшего числа токенов.
Все это говорит о том, что бенчмарк измеряет не только модель, но иинфраструктуру, настройки API, дизайн харнесса.
А разница в 6 раз по токенам - это разница в стоимости агентных задач.
Это в очередной раз доказывает, что ценность смещается с модели на харнесс.
Post #13257
2.76K