TGViewer
Agentic Engineer Agentic Engineer @data_engi · 690 subscribers
Post #1401 95
Агентный рантайм и LLM-сервер наконец научили разговаривать 🤪

5 октября исследователи представили HEAR — двусторонний протокол между агентным рантаймом и сервером инференса.

Сейчас каждый слой видит только половину картины:

🔘 рантайм знает роли агентов, зависимости, будущие вызовы и время жизни контекста;

🔘 сервер знает очереди, загрузку GPU, состояние KV-кеша и доступные режимы выполнения.

HEAR позволяет передавать эти данные в обе стороны. Например, рантайм сообщает, что конкретный контекст скоро понадобится снова, а сервер отвечает, остался ли его кеш в памяти. После этого можно раньше запустить «горячий» запрос или не выбрасывать нужный кеш.

На SCBench такая координация дала ускорение всей пачки в 1,61 раза и сократила медианное время до первого токена в 2,23 раза. В сценариях с исследовательскими агентами полное выполнение ускорилось в 1,23–2,45 раза без замеченного ухудшения качества.

Для тебя главный вывод: оптимизировать отдельный вызов LLM уже недостаточно. Агентный рантайм должен передавать серверу намерения и ограничения, а получать обратно фактическое состояние ресурсов.

В протоколе полезно разделены «пожелание» и обязательное требование, а также «операция принята» и «операция выполнена». Это защищает оркестратор от ложного предположения, что кеш уже подготовлен или ресурс гарантирован.

Пока HEAR — исследовательское предложение, проверенное авторами на четырёх нагрузках, а не принятый отраслевой стандарт. Передаваемая служебная информация также требует изоляции арендаторов и контроля доступа.

Пруфы:
⏩исследование HEAR
⏩экспериментальная реализация

#aiagents #llminference #agentarchitecture #kvcache #orchestration #llmops

@data_engi
arXiv.org Can Agent Harnesses and Inference Engines Hear Each Other? The... LLM agents increasingly execute complex workflows involving multi-turn reasoning, tool use, and parallel agents. Efficient serving requires decisions that span two layers with complementary...
More from @data_engi
  1. Oct 7, 2026AI-агенту поручили написать дешёвую замену самому себе 🧐 6 октября исследователи представ…
  2. Oct 6, 2026Redshift вынес материализованные представления в открытый Iceberg 5 октября AWS добавила в…
  3. Oct 6, 2026Post #1399
  4. Oct 5, 2026@data_engi
  5. Oct 5, 2026С днём учителя! @data_engi
  6. Oct 5, 2026Промптом можно пролезть без очереди на LLM-сервере 😁 2 октября исследователи описали JIL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →