TGViewer
Ethical Machines Ethical Machines @ethicalmachines · 1.07K subscribers
Post #63 559
Как ускорить оценку качества AI-продуктов: топ-3 фичи

Оценка качества aka Eval-s — это почти бесконечные попытки сделать работу AI-продукта точнее / безопаснее / быстрее / дешевле. И со временем этот процесс начинает отнимать у команды все больше времени, потому что:
🟣растет трафик — например, 20+ миллионов трейсов за месяц, которые надо разгребать
🟣нужно постоянно экспериментировать с пайплайном — чтобы он тянул нагрузку и не терял в качестве
🟣и параллельно тестировать более легкие модели — чтобы запросы пользователей стоили дешевле

Поэтому важно сделать процесс максимально удобным и быстрым. Делюсь топ-3 фичами из разных продуктов, которые могут упростить рутину вашей команды вокруг оценки качества:

1️⃣ Loop от Braintrust

Это буквально AI-ассистент, который работает поверх всех prod-логов продукта и помогает:
🟣находить общие паттерны запросов и ошибок за счет кластеризации трейсов с низкими скорами
🟣ловить аномалии в костах и предлагать новые метрики

Можно также из одного окна работать над улучшением промптов и делать еще много интересных вещей. Очень рекомендую посмотреть на этот инструмент. Полтора года назад, когда я созванивалась с командой Braintrust на демо, продукт выглядел простым, но не впечатляющим — а сейчас это один из самых продуманных продуктов в этой нише.

Кстати, еще они много пишут про кейсы своих клиентов: например, кейс Notion, которые сократили время на деплой обновленной модели до < 24 часов

2️⃣ Insights Agent от LangSmith

Идея очень похожа на Loop: внутри фичи находится LLM-пайплайн (хоть они это и называют Agent, судя по архитектуре не очень похоже), который "кластеризует" трейсы и выводит итоговый отчет. Под капотом примерно следующая цепочка действий:
🟣сэмплирование трейсов
🟣саммаризация каждого трейса
🟣подсчет заданных атрибутов
🟣категоризация по нескольким уровням
🟣агрегация и построение отчета

Может показаться, что это мало чем отличается от LLM-as-a-Judge. Но если Judge оценивает один ответ, то Insights Agent смотрит на тысячи трейсов сразу и сам выделяет паттерны

3️⃣ Prompt Learning от Arize Phoenix

Еще один подход к улучшению промптов, состоящий из нескольких компонент:
🟣базовый промпт, prod LLM, input и output — ваш текущий системный промпт, модель, запрос и ответ
🟣evaluatorLLM-as-a-judge или человек, который пишет объяснение, почему промпт плохой
🟣meta-prompt controller — отдельная LLM, которая читает объяснение выше и решает, как поменять инструкции в базовом промпте

И такой цикл может состоять из N итераций. Например, у себя на странице Arize пишут, что при 50 правилах в evaluator, Accuracy после 1-ой итерации составила 66%, а после 5-ой — 82%

Итого

Все 3 фичи, в первую очередь, направлены на ускорение интерпретации результатов и ошибок, потому что это одни из самых долгих и дорогих действий.
А как вы у себя делаете процесс оценки качества удобнее? Очень интересно услышать ваши лайфхаки 😏
  • 🔥 3
  • 👍 2
  • ❤ 1
  • 💅 1
More from @ethicalmachines
  1. Sep 15, 2026Чувствительные данные: как находить и маскировать Одна из задач guardrails — контролироват…
  2. Aug 12, 2026Креативность × AI Надеюсь, ваше лето проходит так же классно, как внезапные летние каникул…
  3. Jun 3, 2026И делюсь с вами презентацией — думаю, она точно будет полезна тем, кто начинает разбиратьс…
  4. Jun 3, 2026Сегодня у меня день рождения 🙌🏼 Отметила его по-взрослому: провела день на работе с колл…
  5. May 22, 2026AI в каждый японский дом
  6. May 20, 2026AI в Японии Путешествуя по Японии, я начала замечать на улицах баннеры с AI — в метро, маг…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →