Модель или обвязка?
Если вы разрабатываете ИИ-агентов для продакшена, эту статью стоит сохранить.
Авторы собрали 41 типичный сценарий отказа и классифицировали их по тому, на стыке каких компонентов возникает проблема. Каждая ошибка привязывается к взаимодействию между моделью, обвязкой, пользователем, инструментами, памятью или окружением, а также указывает, на какой стороне находится причина и где её нужно исправлять.
Это хорошо отражает реальную картину: большинство проблем ИИ-агентов возникает не в самой модели, а на стыке модели и окружающей её инфраструктуры.
Подход также подходит для автоматического анализа. В тестах на четырёх передовых моделях лучший ИИ-судья достиг коэффициента согласия Коэна 0,76 по сравнению с ручной разметкой. Это позволяет автоматически классифицировать ошибки прямо в продакшене, а не разбирать их вручную после каждого инцидента.
В этом году инженерия обвязки стала одним из главных факторов качества ИИ-агентов, но общего языка для разделения ошибок модели и ошибок обвязки до сих пор не было. Эта работа как раз предлагает такую систему.
Статья: https://arxiv.org/abs/2607.28802
Post #3624
18.7K
