Как ускорить оценку качества AI-продуктов: топ-3 фичи
Оценка качества aka Eval-s — это почти бесконечные попытки сделать работу AI-продукта точнее / безопаснее / быстрее / дешевле. И со временем этот процесс начинает отнимать у команды все больше времени, потому что:
🟣растет трафик — например, 20+ миллионов трейсов за месяц, которые надо разгребать
🟣нужно постоянно экспериментировать с пайплайном — чтобы он тянул нагрузку и не терял в качестве
🟣и параллельно тестировать более легкие модели — чтобы запросы пользователей стоили дешевле
Поэтому важно сделать процесс максимально удобным и быстрым. Делюсь топ-3 фичами из разных продуктов, которые могут упростить рутину вашей команды вокруг оценки качества:
1️⃣ Loop от Braintrust
Это буквально AI-ассистент, который работает поверх всех prod-логов продукта и помогает:
🟣находить общие паттерны запросов и ошибок за счет кластеризации трейсов с низкими скорами
🟣ловить аномалии в костах и предлагать новые метрики
Можно также из одного окна работать над улучшением промптов и делать еще много интересных вещей. Очень рекомендую посмотреть на этот инструмент. Полтора года назад, когда я созванивалась с командой Braintrust на демо, продукт выглядел простым, но не впечатляющим — а сейчас это один из самых продуманных продуктов в этой нише.
Кстати, еще они много пишут про кейсы своих клиентов: например, кейс Notion, которые сократили время на деплой обновленной модели до < 24 часов
2️⃣ Insights Agent от LangSmith
Идея очень похожа на Loop: внутри фичи находится LLM-пайплайн (хоть они это и называют Agent, судя по архитектуре не очень похоже), который "кластеризует" трейсы и выводит итоговый отчет. Под капотом примерно следующая цепочка действий:
🟣сэмплирование трейсов
🟣саммаризация каждого трейса
🟣подсчет заданных атрибутов
🟣категоризация по нескольким уровням
🟣агрегация и построение отчета
Может показаться, что это мало чем отличается от LLM-as-a-Judge. Но если Judge оценивает один ответ, то Insights Agent смотрит на тысячи трейсов сразу и сам выделяет паттерны
3️⃣ Prompt Learning от Arize Phoenix
Еще один подход к улучшению промптов, состоящий из нескольких компонент:
🟣базовый промпт, prod LLM, input и output — ваш текущий системный промпт, модель, запрос и ответ
🟣evaluator — LLM-as-a-judge или человек, который пишет объяснение, почему промпт плохой
🟣meta-prompt controller — отдельная LLM, которая читает объяснение выше и решает, как поменять инструкции в базовом промпте
И такой цикл может состоять из N итераций. Например, у себя на странице Arize пишут, что при 50 правилах в evaluator, Accuracy после 1-ой итерации составила 66%, а после 5-ой — 82%
Итого
Все 3 фичи, в первую очередь, направлены на ускорение интерпретации результатов и ошибок, потому что это одни из самых долгих и дорогих действий.
А как вы у себя делаете процесс оценки качества удобнее? Очень интересно услышать ваши лайфхаки 😏
Post #63
559
- 🔥 3
- 👍 2
- ❤ 1
- 💅 1