📰 RAG: eval и данные важнее кода
По данным статьи, автор построил RAG-бота для модерации крипточатов и обнаружил, что стандартные улучшения (BM25, реранкер) на его данных ухудшили метрики. Ключевой вывод: настоящая работа — в создании честного eval-харнеса и чистке корпуса, а не в коде. Например, из-за неверной разметки эталона метрика показывала 38%, хотя реальная точность была выше.
Меня зацепило, что автор честно признал: он чуть не пошёл улучшать рабочий поиск из-за кривой разметки. По-моему, это типичная ловушка для RAG-проектов — все гонятся за модными компонентами, но без качественного eval-набора любые «улучшения» — это гадание. Я бы добавил, что диагностика с разделением позиции правильного ответа и причины промаха должна быть обязательной, но её системно игнорируют.
Источник
#новости
Post #150
348