TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #3513 1.91K
🔥 AutoSaddler - автоматическая оптимизация harness для AI-агентов

Идея простая: модель сама анализирует неудачные запуски агента и переписывает prompts, tools, hooks и middleware.

Но ключевая проблема - улучшение на одном наборе задач легко ломает поведение на других.

AutoSaddler решает это через held-out development set:

- анализирует failed traces
- патчит harness как обычный код
- проверяет обновление на задачах, которых модель не видела при исправлении
- сохраняет патч только если он реально улучшает общую работу агента

Авторы показывают, что без такой проверки автоматическая оптимизация может в итоге дать результат хуже исходного hand-written harness.

Полезная идея для тех, кто вручную или через LLM тюнингует агентов: считать не только исправленные ошибки, но и новые регрессии.

https://arxiv.org/abs/2608.23041
  • ❤ 6
  • 👍 4
  • 🤔 2
More from @machinelearning_ru
  1. Sep 20, 2026📌Goldman Sachs повысил прогноз по развитию физического ИИ Финансовый конгломерат обновил…
  2. Sep 18, 2026🧠 ИИ может «думать дольше», не генерируя длинную цепочку рассуждений Исследователи предст…
  3. Sep 17, 2026🔥 Cohere ускорила LLM inference на H100 с помощью megakernel - до 1,58× быстрее vLLM Обыч…
  4. Sep 17, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  5. Sep 17, 2026🔥 China Telecom открыла Xing4.0-29B-A4B - MoE-модель на 29B параметров, где на каждом шаг…
  6. Sep 16, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →