TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #848 2.2K
Агент выбрасывает рабочую идею не потому, что она плохая. Потому что замер не досчитался.

Санкальп, он же dejavucoder, две недели гонял Codex на конкурсе GPU Mode по батчевому QR-разложению. Больше 1 500 сабмитов, 12-е место из 183, ускорение в 232 раза: базовый torch.geqrf считал около 419 000 микросекунд, финальное ядро — 1 805.

Интересно не то, что получилось. Интересно, что он к концу вписал в AGENTS.md — файл опубликован целиком. Есть там и бодрящее «не бойся рисковать», но каркас держат четыре правила про улики.

— Таймаут — не улика. Дословно: «Treat a timeout as inconclusive, not as a correctness/performance rejection». Прогон не завершился — значит, про идею по-прежнему не известно ничего.

— Уликой считается только досчитавшийся прогон: пройденные или проваленные тесты и время.

— Никакого восхождения от одного лидера. Держать не меньше трёх живых семейств идей сразу, и одно из них — заведомо рискованное.

— Семейство не хоронить по одиночным провалам. Если две идеи по отдельности нейтральны, но чинят разные издержки, сначала совместить и только потом закапывать.

Вот это и есть приём, ради которого я притащил историю. Ни одно из четырёх правил не про модель и не про промпт. Все четыре про одно: что считать достаточным основанием, чтобы признать идею мёртвой. У агента по умолчанию таким основанием работает любой плохой ответ, включая отсутствие ответа.

Теперь переносим к себе, потому что схема у вас та же, только без лидерборда. Агент правит код, гоняет тесты, один падает по таймауту — и агент откатывает правку. Хотя про правку по-прежнему не известно ничего. У Санкальпа прогоны отваливались во многом из-за забитой очереди конкурса, у вас отвалятся из-за флейка, оборванной сети и кончившегося места в раннере. Для агента разницы нет.

Что сделать сегодня. Открыть свой AGENTS.md или CLAUDE.md и найти строку, которая отделяет доказательство от отсутствия данных. Нет такой строки — её место занимает догадка модели. Признак, по которому решать: пролистайте последние сессии и посчитайте, сколько раз агент переписал работающий код после прогона, который не дошёл до конца.

Честности ради, автор считает свой результат ограниченным — и ограничил его не протокол. Разбор топ-10 показал, что выше залезли за счёт знания предметной области: у входов с низким рангом много нулей, и это надо было использовать, а матрицу стоило держать в fp16, а не гонять между представлениями. Второй промах он называет «unknown unknown» — чистый пробел в предметной области, никаким протоколом он не лечится. Плюс цена вопроса: 14 дней, две подписки общей ценой 220 долларов и один запуск по цели, который крутился больше суток.

https://sankalp.bearblog.dev/autoresearch/

Что в вашем проекте агент считает провалом, хотя это был просто не доехавший прогон?
sankalp's blog Auto-research with codex: How I achieved a 232x Faster Kernel over baseline with Codex in GPU Mode's qr_v2 problem Table of Contents Intro Contest in short Problem intro Why this problem is auto-research-able Learning Enough to Ask Better Questions (Optional) Math f...
  • 👍 1
More from @vibecodingartem
  1. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
  2. Sep 22, 2026МиМо - одна из любимиц пользователей ОпенРоутера. В корпоративном сегменте РФ про нее забы…
  3. Sep 21, 2026🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что П…
  4. Sep 21, 2026Post #991
  5. Sep 21, 2026"Воскресная Астра". Есть такое выражение - "воскресный папа". Папа приходит на 1 день, вок…
  6. Sep 21, 2026В 2000 годах в Подмосковье проводили эксперимент с агентскими системами. Собрали около 500…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →