Улучшение диалоговой модели за счет фидбека пользователей
Вместе с нашумевшей статьей про BlenderBot 3, чуваки из $<&^ %@ опубликовали пару сопутствующих.
В этой они исследуют, как можно получать профит от различного фидбека пользователей:
- бинарный лейбл на ответ модели (понравилось / не понравилось)
- текстовый фидбек в свободной форме на плохой ответ
- исправление одного из
1. запрос в поиск
2. выбор предложений из результатов поиска
3. финальный ответ
Сравнили разные подходы к дообучению моделей для каждого из типов фидбека. Для бинарных лейблов, например, пробовали:
- generate моделью + rerank обученным классификатором
- нагенерили моделью n кандидитов, проскорили их классификатором, и сделали supervised обучение генератора на топ-1 ответах модели
- DIRECTOR - 2 головы у трансформера (LM + classification) со смешиванием вероятностей
Для реальных приложений это самый релевантный кейс. Жаль, что не добавили такой бейзлайн: обычный MLE на позитивных ответах и, опционально, unlikelihood training на негативных.
На скрине human evaluation. Рекомендую посмотреть twitter пост с выводами.
Paper
Post #21
498

- 👍 8
- 🔥 4
- ❤ 1