TGViewer
AI.Insaf AI.Insaf @ai_tablet · 1.19K subscribers
Post #239 888
Harness evaluation - deepeval

Кто-то, возможно, начинает разработку harness решений и скиллов для них. Стало интересно, какие инструменты можно использовать для тестирования качества.

Если для RAG многие использовали Ragas, то для LLM и агентов активно применяются решения для трейсинга, например Langfuse и Phoenix. Однако они больше про observability, хотя на их основе также можно прогонять выборки и анализировать качество. Но нужно что-то для harness и такое есть, DeepEval, спойлер с ним можно и все выше.

Но так или иначе все сводится к одному: прогнать набор тестовых сценариев, сравнить результат с эталоном или заданными критериями, проверить качество контекста и оценить корректность вызовов тулов

PS в итоге наверняка что-то кастомное 😅
Deepeval DeepEval - The LLM Evaluation Framework DeepEval is the open-source LLM evaluation framework for testing and benchmarking LLM applications.
  • ❤ 6
  • 👍 5
  • 🔥 1
  • 🤔 1
More from @ai_tablet
  1. Sep 29, 2026Хороший друг Никита Зелинский со школой ml inside запускает курс по AI-агентам для продакт…
  2. Sep 21, 2026Agents Trust Tools Too Much (arxiv) Почему-то агенты слишком доверяют вызовам тулов как ед…
  3. Sep 20, 2026Measuring LLM Sycophancy under Sustained Multi-Turn Pressure (arxiv) Сложное название для…
  4. Sep 12, 2026Post #252
  5. Sep 9, 2026MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в ко…
  6. Sep 7, 2026Feedback That Backfires arxiv Контринтуитивный вывод в статье. Дефакто в harness-решениях…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →