TGViewer
Пятничный ИИ Пятничный ИИ @va_friday_ai · 225 subscribers
Post #603 97
Что: Почему обвязка может быть важнее самой модели
Ссылка: https://www.youtube.com/watch?v=n9xKblqyQ28
Почему интересно: На мероприятии Y Combinator Paper Club показали, как инфраструктура вокруг модели (то, что иногда называют "просто промт-инжинирингом") даёт больший прирост качества, чем обновление самих моделей. Собственно, харнес (harness) - это всё, что окружает модель (управление контекстом, память, инструменты, песочница, оркестрация агентов, промты и петля обратной связи).
В часовом видео (в формате демо) разобрали три примера построения эффективных агентов на LLM с фокусом на харнес.
Во-первых, Prime Agent от Prime Intellect, в котором реализовано самоулучшающееся окружение. Сет Картен показал, как харнес эволюционирует во время работы: у него есть Continual Harness, хранилище промтов, воспоминаний, описаний навыков и спецификаций низкоуровневых агентов. Агент может выполнить команду refine, проанализировать свою траекторию и применить небольшие изменения к собственному харнесу. Контекст в Prime Agent работает как трёхуровневый кэш: L1 - это веса модели, L2 - харнес-состояние (промты, память), а L3 - файлы и низкоуровневые агенты. Такой подход превращает статичную LLM в систему с пресистентным состоянием, что соответствует переходу от машины Тьюринга к фон-неймановскому компьютеру.
Справедливости ради, нигде не уточнялось, какая именно модель, какой сплит ARC-AGI и какие именно правки в харнесе дали скачок с 30% до 95% (это важно, потому что лучший харнес может означать что угодно, от уточнения промта до сложной мультиагентной архитектуры). Также не был освещён вопрос безопасности. Если агент переписывает свою обвязку, кто гарантирует, что он не оптимизирует себя в сторону, которую разработчик не предусмотрел?
Второй докладчик из Стэнфорда представил OpenJarvis, который реализован на работающем локально стеке и, по словам автора, получился в 800 раз дешевле облака. Как было отмечено, локальные открытые модели обычно отстают от фронтира на 6-12 месяцев, но сейчас имеющегося уровня уже достаточно для решения большинства личных задач. Причём оптимизировать этот локальный стек можно с помощью лучших облачных моделей. Достаточно один раз заплатить за топовый GPT или Claude, чтобы они написали качественный промт и архитектуру, а потом крутить это локально и условно бесплатно.
Здесь стоит обратить внимание на отсутствие бенчмарков и методологии расчёта, относительно чего получено красивое число прироста эффективности.
Последний доклад приоткрыл внутреннюю кухню самого YC - их агента QM. YC прошли путь от скриптов до 50 агентов на базе OpenClaw. Ключевые идеи: агент сам выбирает песочницу и модель под задачу, "мозг" вытаскивается из песочницы для переиспользования, а инструмент grind даёт агентам бюджеты на достижение целей вместо пошаговых инструкций.
Несмотря на ряд вопросов к методологии, видео получилось интересным и полезным всем, кто строит агентов. Да, заголовок у видео несколько кликбейтный, но харнес-инжиниринг, похоже, становится полноценной дисциплиной. Сейчас побеждает тот, кто умеет грамотно управлять тестовым временем и архитектурой обвязки, а не просто выбирает модель на полпроцента лучше на синтетическом бенчмарке.

#eng #видео #агент #harness #yc #opensource #llm #харнес #primeagent #openjarvis #qm
YouTube Why The Harness Matters More Than The Model | YC Paper Club Harnesses get dismissed as just scaffolding, just prompt engineering, and not real research. But that couldn't be farther from the truth. The same model weights that score 30% on ARC-AGI score 95% with a better harness. So we gathered a group of researchers…
  • 👍 1
More from @va_friday_ai
  1. Oct 5, 2026Что: NVIDIA Open Agent Safety Platform позволит ограничивать поведение агентов на уровне ж…
  2. Oct 1, 2026Что: Осенний отчёт a16z о состоянии рынков - ИИ-пузырь, триллионные капитальные затраты и…
  3. Sep 30, 2026Что: В MIT задумались о роли образования в эпоху, когда ИИ способен выполнить почти любое…
  4. Sep 28, 2026Что: Осенний open source дамп: суверенная MoE-модель от Яндекса, рассуждающий гигант от Xi…
  5. Sep 27, 2026Что: Matryoshka Attribution помогает найти веса сети, отвечающие за конкретное поведение С…
  6. Sep 26, 2026Что: Предложен подход по интеграции обвязки агента прямо в веса модели Ссылка: https://arx…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →