Что: Почему обвязка может быть важнее самой модели
Ссылка: https://www.youtube.com/watch?v=n9xKblqyQ28
Почему интересно: На мероприятии Y Combinator Paper Club показали, как инфраструктура вокруг модели (то, что иногда называют "просто промт-инжинирингом") даёт больший прирост качества, чем обновление самих моделей. Собственно, харнес (harness) - это всё, что окружает модель (управление контекстом, память, инструменты, песочница, оркестрация агентов, промты и петля обратной связи).
В часовом видео (в формате демо) разобрали три примера построения эффективных агентов на LLM с фокусом на харнес.
Во-первых, Prime Agent от Prime Intellect, в котором реализовано самоулучшающееся окружение. Сет Картен показал, как харнес эволюционирует во время работы: у него есть Continual Harness, хранилище промтов, воспоминаний, описаний навыков и спецификаций низкоуровневых агентов. Агент может выполнить команду refine, проанализировать свою траекторию и применить небольшие изменения к собственному харнесу. Контекст в Prime Agent работает как трёхуровневый кэш: L1 - это веса модели, L2 - харнес-состояние (промты, память), а L3 - файлы и низкоуровневые агенты. Такой подход превращает статичную LLM в систему с пресистентным состоянием, что соответствует переходу от машины Тьюринга к фон-неймановскому компьютеру.
Справедливости ради, нигде не уточнялось, какая именно модель, какой сплит ARC-AGI и какие именно правки в харнесе дали скачок с 30% до 95% (это важно, потому что лучший харнес может означать что угодно, от уточнения промта до сложной мультиагентной архитектуры). Также не был освещён вопрос безопасности. Если агент переписывает свою обвязку, кто гарантирует, что он не оптимизирует себя в сторону, которую разработчик не предусмотрел?
Второй докладчик из Стэнфорда представил OpenJarvis, который реализован на работающем локально стеке и, по словам автора, получился в 800 раз дешевле облака. Как было отмечено, локальные открытые модели обычно отстают от фронтира на 6-12 месяцев, но сейчас имеющегося уровня уже достаточно для решения большинства личных задач. Причём оптимизировать этот локальный стек можно с помощью лучших облачных моделей. Достаточно один раз заплатить за топовый GPT или Claude, чтобы они написали качественный промт и архитектуру, а потом крутить это локально и условно бесплатно.
Здесь стоит обратить внимание на отсутствие бенчмарков и методологии расчёта, относительно чего получено красивое число прироста эффективности.
Последний доклад приоткрыл внутреннюю кухню самого YC - их агента QM. YC прошли путь от скриптов до 50 агентов на базе OpenClaw. Ключевые идеи: агент сам выбирает песочницу и модель под задачу, "мозг" вытаскивается из песочницы для переиспользования, а инструмент grind даёт агентам бюджеты на достижение целей вместо пошаговых инструкций.
Несмотря на ряд вопросов к методологии, видео получилось интересным и полезным всем, кто строит агентов. Да, заголовок у видео несколько кликбейтный, но харнес-инжиниринг, похоже, становится полноценной дисциплиной. Сейчас побеждает тот, кто умеет грамотно управлять тестовым временем и архитектурой обвязки, а не просто выбирает модель на полпроцента лучше на синтетическом бенчмарке.
#eng #видео #агент #harness #yc #opensource #llm #харнес #primeagent #openjarvis #qm
Post #603
97