TGViewer
Голос из-под шторки | Миша Левченко Голос из-под шторки | Миша Левченко @izpodshtorki · 1.37K subscribers
Post #246 1.88K

Forwarded from LLM под капотом

Анализ кода агента с первым местом в слепом прогоне BitGN PAC1

Итак, Operation Pangolin получил первое место в слепом прогоне в Accuracy Leaderboard (поделил его с codex-on-rails)

Что у него под капотом? Это не столько чат-бот агент, сколько компактный программируемый аналитик со строгим чеклистом и REPL циклом.

Ядро написано на TypeScript. Там вызывается Anthropic Claude (для отладки - Sonnet, для соревнования - Opus). Причем у LLM-ки есть не куча инструментов, а только один - execute_code. То есть LLM-ка генерирует код на Python, который получает доступ к инструментам рантайма через класс Workspace, а еще памяти (scratchpad) и словарику с переменными. Результаты работы передаются обратно в Claude. Повторяем, пока код в итоге не выдаст ответ через ws.answer(scratchpad, verify), который успешно пройдет встроенную верификацию.

Решение работает очень хорошо, используя сильные стороны Claude по интерактивному анализу и написанию кода, подкрепленные заложенным заранее списком правил в чеклиста.

Слабые места решения (классы задач, на которых архитектура ломалась) - это:
- спрятанные в документах вредоносные инструкции, например t011
- удаление пачки файлов - t006
- кейсы, когда мы описываем сущности и проекты (и нужна LLM-ка, чтобы их найти) - t025, t051
- работа с датами, например t012, t037

Но при всем при этом, решение заняло первое место и показало результат лучше более сложных систем. Чтобы повторить в своем решении:

- упрощаем число инструментов
- даем агенту возможность писать код
- даем возможность сохранять память и результаты работы
- Прописываем четкие чеклисты и процесс валидации

Автор Operation Pangolin - @i_november!

Поздравляю с первым местом в соревновательной части BitGN PAC1! Решение заняло первое место в Accuracy Leaderboard (87 очков, поделили с codex-on-rails) и с первым местов в Ultimate Leaderboard (92 очка). Исходники - в GitHub.

Задавать вопросы автору можно прямо в комментариях к посту. Туда же я скину график, который сравнивает поведение этого агента с запусками всех других агентов в соревновательном прогоне.

Кто помнит хроники спасения проекта с LLM под капотом? Там использовалась схожая архитектура, где LLM генерила кучу кода, который и выполнял всю работу с выдающейся точностью.

Ваш, @llm_under_hood 🤗
  • ❤ 4
  • ✍ 1
  • 🔥 1
  • 🤔 1
  • 🤝 1
More from @izpodshtorki
  1. Sep 19, 2026Держу в курсе: агент закончил работу. Результат быть может корректен, но им пользоваться н…
  2. Sep 19, 2026Slop Driven Development > Spec Driven Development aka Agile > Waterfall Я в очередной раз…
  3. Sep 1, 2026Коллеги попросили меня позвать вас на Глубокую Ночь Технологий (Ночь Глубоких Технологий?)…
  4. Jun 14, 2026Кстати, про Karabiner мне когда-то рассказал Артур Думчев, он как раз собирает себе новую…
  5. Jun 14, 2026Кстати, пока мы на клавиатурной теме. Если пользуетесь макбуком недавно — помните, что opt…
  6. Jun 14, 2026Без этой программы мне физически тяжело пользоваться макбуком В прошлом посте я обещал рас…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →