Всем привет!
Сегодня хочу поделиться своим новым исследованием, которое прошло рецензирование и было опубликовано в Journal of Electrical Systems and Information Technology.
Ссылка на публикацию
В статье проводится анализ существующих подходов к оценке качества систем, построенных на основе генеративного искусственного интеллекта. Рассматриваются лексические методы (TF-IDF и BM25), семантические эмбеддинги, гибридные подходы на основе концепции LLM-as-a-Judge, а также методы, основанные на распознавании логического следования в естественном языке (Natural Language Inference, NLI).
Особое внимание уделено разработке алгоритма выбора оптимальной стратегии оценки для различных задач с учетом таких факторов, как скорость оценки, точность и интерпретируемость результатов, а также стабильность и воспроизводимость оценки.
В работе также представлены результаты сравнительного анализа различных методов оценки на примере проверки точности и релевантности ответов ИИ-системы на наборе из 500 тестовых примеров. В зависимости от выбранного подхода корреляция с экспертными оценками реального человека составила от 0,67 до 0,92.
Предложенный алгоритм может использоваться для построения эффективного процесса оценки ИИ-систем в самых разных предметных областях.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #160
562
s43067-026-00374-6.pdf2.2 MB
- 🔥 6
- 👍 4