Исследователи Meta* предложили «генеративный верификатор» — маленькую модель, которая перепроверяет шорт-лист готовой системы отбора кандидатов и вытаскивает наверх то, что та задвинула вниз. Саму систему при этом не трогают: ни переобучения, ни пересборки индекса.
Тестировали на двух бенчмарках — товарах Amazon и открытом YaMBDa от Яндекс Музыки (обезличенные прослушивания в трёх размерах: 50 млн, 500 млн и 5 млрд взаимодействий).
И вот тут началось интересное:
🟢 Чем крупнее каталог, тем сильнее эффект: на максимальном масштабе — 5 млрд взаимодействий и 5,4 млн треков — Recall@10 у всех трёх моделей вырос на 25–30%. На Amazon, где каталог — пара тысяч товаров, прибавка куда скромнее: 6–15%.
🟢 Вывод Meta*: на гигантских каталогах стандартные ретриверы захлёбываются правдоподобным мусором в топе — и тут выручает дополнительная проверка кандидатов.
Такие дела: без наших датасетов никуда.
Статья тут 😎
*запрещенная в РФ организация
@xor_journal
