Одна и та же модель на одном и том же бенчмарке дала 17,5% и 98,0%. Разницу сделала не модель, а обвязка вокруг неё.
Грег Камрадт из ARC Prize опубликовал 3 сентября замер GPT-6 Astra на ARC-AGI-3 и прогнал её через два харнесса. Стандартный оставляет модели только те заметки, которые она сама решила сохранить. Провайдерский хранит между запросами непрозрачное состояние рассуждений и сжимает длинный диалог, чтобы модель переиспользовала уже сделанную работу.
Оба процента выше сняты на низком
reasoning effort. Провал стоил $38 166, успех — $21 298.
Хуже результат за большие деньги. По 167 парам «игра — уровень рассуждения», которые решили оба харнесса, провайдерский потратил на 49% меньше токенов и отработал в 3,66 раза быстрее.
Тут легко отмахнуться: провайдерский харнесс лезет во внутреннее состояние модели, вам такого не дадут. Только этажом ниже, там, где всё ваше, работает ровно тот же механизм.
Инженер AgentConnect Пэнчэн Сюй сравнил grep и семантическую навигацию через LSP на задачах переименования, а потом поменял в семантическом туле одну вещь: стал прикладывать к каждой найденной ссылке ±2 строки исходника. Бэкенд и набор ссылок остались прежними.
Pass@1 вырос с 0,67 до 0,83, а дочитывания файлов упали с 15,2 до 3,2 за эпизод. Его формулировка:
Бэкенд поиска не менялся ни разу — менялась только форма того, что возвращалось.
Обе истории про одно: обвязка выбрасывает то, что модель уже нашла, и модель добывает это заново за ваши токены. У вас та же развилка стоит на каждом кастомном туле и каждом MCP-сервере. Тул, который отдаёт
{file, line, col}, отправляет агента открывать эти файлы руками.
Возьмите инструмент, который агент дёргает чаще всех, и посмотрите, можно ли из его ответа принять следующее решение, не открыв ещё один файл. Нельзя — это не инструмент, а указатель.
Это не значит «поставьте правильный харнесс и получите 98%». Провайдерский харнесс Astra не воспроизводится: он держит то, чего ARC Prize не видит. А замер про grep — из блога собственного продукта автора, и пилотом его называет он сам: три модели, несколько репозиториев, два-три прогона на ячейку.
https://arcprize.org/blog/astrahttps://www.agentconnect.md/blog/grep-beat-lsp-harness/Что ваш самый частый инструмент возвращает агенту, кроме координат?