TGViewer
Ethical Machines Ethical Machines @ethicalmachines · 1.07K subscribers
Post #62 595
Observability & Evals AI-Продуктов: Базовый Джентльменский Набор

Год назад я рассказывала об инструментах для наблюдения за AI-продуктами и оценки их качества. Картинка с тех пор особо не изменилась — появились интересные продукты и фичи, но речь о Disruptive innovation тут точно не идет.

Но дело не в инструментах. Многие команды думают, что достаточно подключить инструмент — и оценка качества заработает сама. Поставил, нажал кнопку, получил дашборд. А инструмент — это только обёртка. И вся суть — в создании процесса оценки качества, который включает 5 шагов:

1️⃣ Определите, что такое качественный ответ
🟣Возьмите набор разных запросов и дайте его нескольким менеджерам. Попросите написать ответы, которые бы их устроили. Там, где совпали — это ваш референс. А там, где разошлись — нужно обсудить и прийти к единому мнению. Так вы получите сразу три вещи: критерии качества, эталонный датасет для первых проверок и материал для обучения разметчиков

2️⃣ Настройте логирование / трейсинг
🟣Во время разработки AI-продуктов многое может пойти не так, поэтому важно логировать не только запрос и финальный ответ, но и всю цепочку событий, которую называют трейсом. Только так вы сможете находить ошибки и разбираться в их причинах. Не ждите первого инцидента — к тому моменту данных для разбора у вас просто не будет

3️⃣ Выберите метрику качества
🟣Для каждого трейса оценивайте не только финальный ответ, но и промежуточные состояния. Начните с самого важного для вас. Например, если критичны достоверность и релевантность — переведите каждый критерий в бинарную метрику: "доля случаев, когда ответ был достоверным", "доля случаев, когда ответ был релевантным". Хорошая метрика всегда отражает реальную боль бизнеса и читается без пояснений

4️⃣ Организуйте процесс разметки данных
🟣Первые циклы разметки оценки качества обычно выполняет сама команда. Как только согласованность (совпадение ответов разных людей при разметке одного и того же кейса) составляет > 95%, можно масштабировать. Для разметки бинарных критериев хорошо подходит LLM-as-a-Judge. Но в кейсах, где требуется глубокая доменная экспертиза, лучше, конечно, привлекать людей

5️⃣ Постройте дашборд с основными результатами
🟣Следите не только за качеством, но и за техническими метриками: типами ошибок, скоростью ответа, количеством токенов и итоговыми расходами. Цель — не просто давать точные ответы, но и делать это быстро и дёшево. И такой дашборд сделает качество видимым для всей команды

Если у вас есть вопросы по оценке качества AI-продуктов или хотите разобраться, с чего начать именно в вашем случае — пишите в комментарии или в лс, давайте разбираться вместе 🙌
Telegram Ethical Machines Инструменты для оценки качества моделей и LLM-агентов Вот вы взяли open-source LLM, натренировали свою модель (ну, вдруг, вы очень богаты) или же построили LLM агента: какие инструменты теперь использовать, чтобы узнать, а насколько хорошо работает это решение…
  • 👍 3
  • 🔥 3
  • 🤔 2
More from @ethicalmachines
  1. Sep 15, 2026Чувствительные данные: как находить и маскировать Одна из задач guardrails — контролироват…
  2. Aug 12, 2026Креативность × AI Надеюсь, ваше лето проходит так же классно, как внезапные летние каникул…
  3. Jun 3, 2026И делюсь с вами презентацией — думаю, она точно будет полезна тем, кто начинает разбиратьс…
  4. Jun 3, 2026Сегодня у меня день рождения 🙌🏼 Отметила его по-взрослому: провела день на работе с колл…
  5. May 22, 2026AI в каждый японский дом
  6. May 20, 2026AI в Японии Путешествуя по Японии, я начала замечать на улицах баннеры с AI — в метро, маг…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →