ИИ-агент прошёл тест. Но это ещё не основание запускать его в работу
На защите пилота руководителю показывают одну убедительную цифру — долю успешных ответов. Если она высокая, агента предлагают запускать в работу. Новый бенчмарк LayerRAG показывает, почему такое решение может быть ошибочным.
Авторы проверили девять моделей на 240 задачах корпоративного поиска. Когда в данных менялась структура, её автоматическое исправление поднимало долю успешных ответов с 0 до 91,3%. Проблема выглядела решённой.
Это впечатляющий результат — и одновременно ловушка. Тот же способ ничего не исправлял, когда источник устаревал, подключённый инструмент не возвращал ответ, пользователю запрещался доступ или в запрос попадали данные из чужой сессии.
Исследование другого корпоративного агента, Leni, подтвердило общий вывод. Авторы разбирали, откуда берётся прирост качества. Дополнительный цикл перепроверки дал лишь 1,5 процентного пункта. Большую часть эффекта они связали с тем, как система делит задачу на этапы, выбирает подходящую модель и передаёт ей запрос.
Обе работы пока остаются препринтами, поэтому их цифры нельзя превращать в норматив. Но директору по продукту или CIO они дают более точный набор вопросов перед запуском: работает ли агент с актуальным источником, замечает ли пропавший ответ инструмента, соблюдает ли права доступа и не смешивает ли пользовательские сессии.
Если критичный для бизнеса сценарий не проверен отдельно, высокий общий балл — аргумент продолжить тестирование, а не разрешить запуск.
Источники: LayerRAG-Bench · разбор надёжности Leni
Post #1554
388

- 👍 1