Observability & Evals AI-Продуктов: Базовый Джентльменский Набор
Год назад я рассказывала об инструментах для наблюдения за AI-продуктами и оценки их качества. Картинка с тех пор особо не изменилась — появились интересные продукты и фичи, но речь о Disruptive innovation тут точно не идет.
Но дело не в инструментах. Многие команды думают, что достаточно подключить инструмент — и оценка качества заработает сама. Поставил, нажал кнопку, получил дашборд. А инструмент — это только обёртка. И вся суть — в создании процесса оценки качества, который включает 5 шагов:
1️⃣ Определите, что такое качественный ответ
🟣Возьмите набор разных запросов и дайте его нескольким менеджерам. Попросите написать ответы, которые бы их устроили. Там, где совпали — это ваш референс. А там, где разошлись — нужно обсудить и прийти к единому мнению. Так вы получите сразу три вещи: критерии качества, эталонный датасет для первых проверок и материал для обучения разметчиков
2️⃣ Настройте логирование / трейсинг
🟣Во время разработки AI-продуктов многое может пойти не так, поэтому важно логировать не только запрос и финальный ответ, но и всю цепочку событий, которую называют трейсом. Только так вы сможете находить ошибки и разбираться в их причинах. Не ждите первого инцидента — к тому моменту данных для разбора у вас просто не будет
3️⃣ Выберите метрику качества
🟣Для каждого трейса оценивайте не только финальный ответ, но и промежуточные состояния. Начните с самого важного для вас. Например, если критичны достоверность и релевантность — переведите каждый критерий в бинарную метрику: "доля случаев, когда ответ был достоверным", "доля случаев, когда ответ был релевантным". Хорошая метрика всегда отражает реальную боль бизнеса и читается без пояснений
4️⃣ Организуйте процесс разметки данных
🟣Первые циклы разметки оценки качества обычно выполняет сама команда. Как только согласованность (совпадение ответов разных людей при разметке одного и того же кейса) составляет > 95%, можно масштабировать. Для разметки бинарных критериев хорошо подходит LLM-as-a-Judge. Но в кейсах, где требуется глубокая доменная экспертиза, лучше, конечно, привлекать людей
5️⃣ Постройте дашборд с основными результатами
🟣Следите не только за качеством, но и за техническими метриками: типами ошибок, скоростью ответа, количеством токенов и итоговыми расходами. Цель — не просто давать точные ответы, но и делать это быстро и дёшево. И такой дашборд сделает качество видимым для всей команды
Если у вас есть вопросы по оценке качества AI-продуктов или хотите разобраться, с чего начать именно в вашем случае — пишите в комментарии или в лс, давайте разбираться вместе 🙌
Post #62
595