Гонка «чья модель умнее» закрылась: рекордную цифру ставит не модель.
OpenAI объявила эру AGI, показав 99,9% на ARC-AGI-3. В тот же день авторы теста выложили таблицу всех прогонов: в их собственном харнессе та же модель даёт 62,7%.
Веса те же, но отличается харнесс — софт вокруг модели, который решает, какими инструментами она пользуется, что помнит между запросами и как ужимается её контекст. При рассуждении “на ноль” показатель внутри адаптера OpenAI всё равно достигает 96,7% – на 34 пункта выше, чем та же модель на максимальном рассуждении в стандартном харнессе.
Работает и в обратную сторону: Nvidia собрала харнесс, с которым Claude Opus 5 прошёл этот тест с 30,2% до прохождения всех уровней. Anthropic, Google и Microsoft уже продают харнессы отдельным продуктом со своим прайсом.
Вторая половина сборки — диспетчер, который сам решает, кому отдать запрос: рутину вниз, тяжёлое наверх. Так устроены Bedrock у Amazon, Cursor, Perplexity. Свои решения в той же области строят Сбер, МТС и Яндекс: последний рассказал, что развивает и харнесс-решения, и умный роутинг, который подбирает инструмент под конкретный запрос.
Итог: если рекорд рисует обвязка, то и переплачивать за верхнюю строчку каталога незачем — что рынок уже и делает. Продаётся модель, а результат даёт собранная вокруг неё система. Зарабатывать будут на инженерии сборки.
😎 Читайте Про tech и этих
Теперь и в MAX
Post #4458
1.43K
- 🔥 4
- 😁 2
- 💯 1
- 🤪 1