Новый подход называется Retrieve-for-Train.
Идея: вместо того чтобы каждый раз заставлять LLM долго думать и генерировать десятки sub-query, тяжёлую работу переносят в обучение.
Схема такая:
query → RL-обученный fan-out LM → синтетические target-наборы → компактный diffusion retrieverВ итоге на inference уже не нужен большой chain-of-thought.
Google обучила компактный 53.9M diffusion retriever, который генерирует весь набор направлений поиска сразу, одним неавторегрессионным проходом.
Результат:
- 12–20× быстрее autoregressive-подходов
- latency остаётся от sub-second до нескольких секунд
- выше diversity, alignment и recall
- меньше дублирующихся sub-query
- не нужны human labels для supervision
Самое интересное: RL здесь используется не как дорогой online reasoning engine, а как одноразовый механизм, который «компилирует» сложное поведение в более дешёвую модель.
Для production-поиска это очень сильная идея: сложное reasoning делается заранее, а inference остаётся быстрым.
https://research.google/blog/bypassing-inference-bottlenecks-accelerating-complex-ai-search-with-retrieve-for-train/
