TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #920 412
Одна и та же модель на одном и том же бенчмарке дала 17,5% и 98,0%. Разницу сделала не модель, а обвязка вокруг неё.

Грег Камрадт из ARC Prize опубликовал 3 сентября замер GPT-6 Astra на ARC-AGI-3 и прогнал её через два харнесса. Стандартный оставляет модели только те заметки, которые она сама решила сохранить. Провайдерский хранит между запросами непрозрачное состояние рассуждений и сжимает длинный диалог, чтобы модель переиспользовала уже сделанную работу.

Оба процента выше сняты на низком reasoning effort. Провал стоил $38 166, успех — $21 298.

Хуже результат за большие деньги. По 167 парам «игра — уровень рассуждения», которые решили оба харнесса, провайдерский потратил на 49% меньше токенов и отработал в 3,66 раза быстрее.

Тут легко отмахнуться: провайдерский харнесс лезет во внутреннее состояние модели, вам такого не дадут. Только этажом ниже, там, где всё ваше, работает ровно тот же механизм.

Инженер AgentConnect Пэнчэн Сюй сравнил grep и семантическую навигацию через LSP на задачах переименования, а потом поменял в семантическом туле одну вещь: стал прикладывать к каждой найденной ссылке ±2 строки исходника. Бэкенд и набор ссылок остались прежними.

Pass@1 вырос с 0,67 до 0,83, а дочитывания файлов упали с 15,2 до 3,2 за эпизод. Его формулировка:


Бэкенд поиска не менялся ни разу — менялась только форма того, что возвращалось.


Обе истории про одно: обвязка выбрасывает то, что модель уже нашла, и модель добывает это заново за ваши токены. У вас та же развилка стоит на каждом кастомном туле и каждом MCP-сервере. Тул, который отдаёт {file, line, col}, отправляет агента открывать эти файлы руками.

Возьмите инструмент, который агент дёргает чаще всех, и посмотрите, можно ли из его ответа принять следующее решение, не открыв ещё один файл. Нельзя — это не инструмент, а указатель.

Это не значит «поставьте правильный харнесс и получите 98%». Провайдерский харнесс Astra не воспроизводится: он держит то, чего ARC Prize не видит. А замер про grep — из блога собственного продукта автора, и пилотом его называет он сам: три модели, несколько репозиториев, два-три прогона на ячейку.

https://arcprize.org/blog/astra

https://www.agentconnect.md/blog/grep-beat-lsp-harness/

Что ваш самый частый инструмент возвращает агенту, кроме координат?
ARC Prize OpenAI's GPT-6 Astra on ARC-AGI-3 | ARC Prize OpenAI's GPT-6 Astra reaches state-of-the-art results on ARC-AGI-3
  • ❤ 2
More from @vibecodingartem
  1. Sep 21, 2026🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что П…
  2. Sep 21, 2026Post #991
  3. Sep 21, 2026"Воскресная Астра". Есть такое выражение - "воскресный папа". Папа приходит на 1 день, вок…
  4. Sep 21, 2026В 2000 годах в Подмосковье проводили эксперимент с агентскими системами. Собрали около 500…
  5. Sep 21, 2026Всем привет! В последнем ролике я делал стратетигию с нуля в 3D на Unity. Я подготовил для…
  6. Sep 21, 2026https://www.youtube.com/watch?v=6_cCufO5c9U&t=1s - У Игоря лучший канал на ютубе о ВайбГей…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →