#papers #news #industry
Leveraging Generative Models for Real-Time Query-Driven Text Summarization in Large-Scale Web Search
AB results ✅, Source code ❌
Проблема
Классические многостадийные системы резюмирования текста на каждом этапе воронки теряют информацию и целостность текстов. А End-to-End LLM модели слишком тяжелые для онлайн-инференса в поиске.
Результат статьи
LLM-модель авторов генерирует резюме сайтов на 20.68% лучше по асессорской разметке (GSB) и на 0.81% кликабельнее (CTR) в АБ, чем прошлая многостадийная система. И чтобы выдержать 50k QPS поисковика Baidu с 78ms latency хватает 334 NVIDIA L20.
Как достигли
1. ERNIE-Lite-8K (10B) дообучается на 1000 человеческих саммари;
2. GPT-2-like (0.1B, с кодовым названием Hamburger) дистиллирует ERNIE на 14M саммари (130B токенов) сайтов из поисковой выдачи;
3. Далее Hamburger дообучается (SFT) на 6160 человеческих саммари, чтобы уменьшить искажение фактов;
4. После дообучается (DPO) на клики из онлайн трафика, периодически повторяя SFT, чтобы не уйти в кликбейт;
5. Финальная модель полностью квантуется в FP8 (веса, активации, KV-кэш) и деплоится на TensorRT-LLM со стратегией Lookahead Decoding, что позволяет ей работать в 68 раз быстрее, чем ERNIE почти без потери качества.
P.S. Картинка из статьи — мечта любого продакта
@ds_league
Post #10
672

- 🔥 7
- 🦄 1