TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.38K subscribers
Post #66 740
Сегодня разберем основные методы оценки ИИ-моделей, которые применяются в генеративных и retrieval-сценариях.
Многие из них пересекаются по сути, поэтому ниже упрощённая и объединённая структура методов.

1. Семантические методы
Оценивают смысловую близость между вопросом, контекстом и ответом.
Используются эмбеддинги и косинусное сходство (например, sentence-transformers, OpenAI text-embedding-3-small, MiniLM).
Чем выше значение, тем сильнее совпадение по смыслу.
Применяется для оценки релевантности найденных фрагментов, совпадения с эталонным ответом, фильтрации нерелевантных контекстов.

2. Лексические методы
Более простые и интерпретируемые.
Основаны на анализе пересечения ключевых слов (Keyword Overlap).
Считается доля совпадений между словами в вопросе и ответе или контексте.
Метод быстрый, но чувствителен к перефразировкам, обычно используется как базовая проверка ответов ИИ решения.

3. Фрагментарная (chunk-based) оценка
Вместо анализа документа целиком проверяется каждый фрагмент (chunk).
Это дает возможность точнее понять, какие куски текста действительно релевантны запросу, а какие просто шум.
Метод активно применяется в RAG-системах, где контекст разбивается на блоки.

4. LLM-based верификация (LLM as a Judge)
Оценка проводится самой языковой моделью, которая получает пару вопрос–контекст или вопрос–ответ и выносит суждение (например, по шкале от 1 до 5).
Используется для проверки релевантности, полноты, соответствия ответа запросу и многих дургих метриках

5. NLI-подход (Natural Language Inference)
Метод логической проверки, который смотрит действительно ли ответ вытекает из данных.
Внешняя модель (например, RoBERTa-large-MNLI или DeBERTa-v3-large-mnli) классифицирует связь между контекстом и утверждением как подтверждение, противоречие или несвязанные, после чего считается финальный скор.
Применяется для контроля достоверности и выявления галлюцинаций.

6. Verdict / смысловая декомпозиция
Метод делит ответ от ИИ решения по смысловым блокам (тезисам).
Каждый блок проверяется на уместность (или соответствии критериям метрики) относительно вопроса.

7. Reverse Questioning
Инверсный метод, модель оценщик (LLM) получает готовый ответ и должна восстановить вопрос.
Если восстановленный вопрос близок к исходному, то значит, ответ действительно отражает суть запроса.
Используется как дополнительная проверка релевантности и смысловой согласованности.


Полезная информация:
Курс по evaluation AI |
Мой фремворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 🔥 5
  • 👍 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →