Агентный рантайм и LLM-сервер наконец научили разговаривать 🤪
5 октября исследователи представили HEAR — двусторонний протокол между агентным рантаймом и сервером инференса.
Сейчас каждый слой видит только половину картины:
🔘 рантайм знает роли агентов, зависимости, будущие вызовы и время жизни контекста;
🔘 сервер знает очереди, загрузку GPU, состояние KV-кеша и доступные режимы выполнения.
HEAR позволяет передавать эти данные в обе стороны. Например, рантайм сообщает, что конкретный контекст скоро понадобится снова, а сервер отвечает, остался ли его кеш в памяти. После этого можно раньше запустить «горячий» запрос или не выбрасывать нужный кеш.
На SCBench такая координация дала ускорение всей пачки в 1,61 раза и сократила медианное время до первого токена в 2,23 раза. В сценариях с исследовательскими агентами полное выполнение ускорилось в 1,23–2,45 раза без замеченного ухудшения качества.
Для тебя главный вывод: оптимизировать отдельный вызов LLM уже недостаточно. Агентный рантайм должен передавать серверу намерения и ограничения, а получать обратно фактическое состояние ресурсов.
В протоколе полезно разделены «пожелание» и обязательное требование, а также «операция принята» и «операция выполнена». Это защищает оркестратор от ложного предположения, что кеш уже подготовлен или ресурс гарантирован.
Пока HEAR — исследовательское предложение, проверенное авторами на четырёх нагрузках, а не принятый отраслевой стандарт. Передаваемая служебная информация также требует изоляции арендаторов и контроля доступа.
Пруфы:
⏩исследование HEAR
⏩экспериментальная реализация
#aiagents #llminference #agentarchitecture #kvcache #orchestration #llmops
@data_engi
Post #1401
95