micro F1 = 0.9358 на 15 классах — звучит как победа, да?
Ну да, обучил multi-label классификатор для модерации Discord-сообщества, выкатил метрику — и можно смело закрывать задачу, похлопав себя по плечу.
Но стоит копнуть глубже и глянуть на precision с recall по каждому классу в отдельности, как картина резко меняется. По TOXIC recall еле-еле 0.78, а для части редких меток test split вообще никакой — положительных примеров кот наплакал.
Подробности — тут на Хабре.
👉 About Python
Post #2893
546