В LLM-инженерии уже мало просто подкрутить промпт или добавить RAG.
В новой статье на Хабре разбираем следующий шаг: как оптимизировать весь harness — среду, в которой работает агент. Это промпты, MCP-профили, доступные инструменты, этапы workflow, память, правила выбора evidence и логика итогового вывода.
Мы проверили подход на диагностическом агенте для PostgreSQL: собрали небольшой бенчмарк на реальных нагрузочных кейсах, прогнали replay и через meta-harness optimization искали более удачные конфигурации агентной среды.
Что получилось:
✅ Целевая метрика выросла на 24,9% в первом запуске и на 17,6% во втором.
✅ Перестановка этапов workflow и подбор MCP-профилей иногда влияли сильнее, чем новая формулировка промпта.
✅ Больше тулов не всегда лучше: широкий набор инструментов может помочь одному типу задач и сломать другой.
✅ Оценивать агента по одному среднему score опасно — нужны устойчивость, latency, сложность, failed runs и качество доказательной базы.
Статья полезна тем, кто уже работает с LLM-агентами и хочет понять, где начинается следующий уровень оптимизации: не модели как таковой, а всей среды, в которой она думает, выбирает инструменты и строит вывод.
🔗 Читайте на Хабре.
🔔 Читайте нас в MAX
Post #1565
1.11K

- 🔥 5
- ❤ 3
- 👍 2