Всем привет!
Хочу поделиться своей недавней работой, которая на данный момент опубликована в виде препринта. В этом исследовании я предложил новый метод оценки под названием TCVA (Temperature-Controlled Verdict Aggregation), который сочетает пятиуровневую шкалу вердиктов с обобщённым степенным средним и интуитивно понятным параметром “температуры” для управления строгостью оценки в зависимости от области применения.
Экспериментальная оценка на трех бенчмарк-датасетах с человеческими аннотациями (SummEval и USR) показывает, что TCVA достигает корреляции с человеческими оценками, сопоставимой с RAGAS по критерию достоверности, и значительно превосходит его по релевантности (коэффициент Спирмена ρ = 0.480 против 0.411, p = 0.041), при этом стабильно превосходя DeepEval на всех датасетах.
Ключевая идея заключается в том, что один и тот же ответ ИИ может быть отличным для чат-бота, но неприемлемым для медицинского ассистента, поэтому уровень строгости должен адаптироваться к домену, и TCVA позволяет это делать без дополнительных вызовов LLM.
Препринт доступен здесь:
https://dx.doi.org/10.21203/rs.3.rs-8658973/v2
Метод также реализован в виде open-source библиотеки:
https://github.com/meshkovQA/Eval-ai-library.git
Буду очень признателен за любую обратную связь, отзывы или цитирование 🙏
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #132
623