TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #43 610
Когда мы говорим об оценке AI, то часто думаем о метриках точности или качества. Но есть еще одна не менее важная грань, это объяснимость (Explainability) и корректность рассуждений (Correctness of reasoning).

Современные модели умеют выдавать ответы, которые выглядят правильно. Проблема в том, что иногда они (модели) угадывают, а иногда придумывают объяснения постфактум. Для критичных областей этого мало, потому что нужен не только правильный ответ, но и понятная логика за ним.

Немного по терминам:
Explainability - насколько прозрачно и понятно человеку решение модели.
Correctness of Reasoning - насколько корректна сама логическая цепочка рассуждений.

Что именно мы оцениваем?
⁃ Насколько объяснение модели прозрачно и понятно человеку.
⁃ Насколько reasoning действительно отражает внутренние шаги, а не случайный текст «для красоты».

Как это оценивать:
⁃ Сравнивать объяснения на близких примерах: если ответы одинаковые, логика тоже должна совпадать (вспоминаем прошлый пост про Метаморфические тесты).
⁃ Проверять, действительно ли объяснение модели опирается на внутренние признаки модели, а не выдумано постфактум (Faithfulness tests).
⁃ Использовать датасеты, где вместе с ответами зафиксированы правильные рассуждения, например, Chain-of-Thought Hub или XAI datasets
⁃ Подключать экспертов, потому что человек быстро замечает, если объяснение звучит убедительно, но не имеет отношения к задаче.

Простой пример:
AI рекомендует фильм и поясняет: «Мы выбрали его, потому что вы смотрели комедии с этим актёром». Если объяснение совпадает с логикой работы алгоритма — reasoning корректен. Но если в реальности рекомендация основана на рекламных приоритетах, а «актёр» просто добавлен для убедительности — reasoning рушится.

По сути, explainability evaluation - это проверка доверия, можно ли положиться на логику модели так же, как на её финальный ответ.


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
  • 👍 5
  • ❤ 1
  • 🔥 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →