Сегодня поговорим о том, что такое bias в AI и почему его важно оценивать.
Bias - это систематическая предвзятость в работе модели. Она возникает из-за того, что данные, на которых обучалась модель, не идеально отражают реальность. Если в датасете больше примеров одного типа, чем другого, модель начинает воспроизводить этот перекос.
Например:
⁃ В рекомендательной системе фильмы определенного жанра могут показываться чаще, потому что таких данных было больше.
⁃В NLP модели ассоциации программист - мужчина и медсестра - женщина закрепляются из-за перекоса в текстах.
⁃ В медицинских AI датасет может быть собран в одном регионе, и тогда модель хуже работает для других групп пациентов.
Почему это важно для тестировщика и исследователя?
Если bias не учитывать, система будет несправедливой и небезопасной. В бизнесе это может привести к дискриминации пользователей, в медицине, к риску для жизни, в образовании, к неправильным рекомендациям и так далее.
Оценка bias - это проверка, насколько модель одинаково хорошо работает для разных групп, ситуаций и формулировок. Для этого создаются специальные тестовые датасеты, где балансируются примеры, используются крайние и граничные кейсы и проверяется, не дает ли модель систематически искаженных ответов.
Bias также может проявляться при использование LLM как оценщика для другой модели, потому что по-моему опыту, если просить в лоб LLM оценить какую-то метрику, то в большинтсве случаев LLM будет завышать показатель, так как будет стараться быть полезной.
По сути, bias-тестирование не про метрики точности, а про справедливость, надежность и непредвзятость модели. Ведь AI-система, которая воспроизводит социальные перекосы, не критична к себе и генерируемым ответам, может быть даже опаснее модели с просто низкой accuracy.
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #53
597

- 👍 4
- ❤ 1