Яндекс выложил в опенсорс модель быстрых ответов в Поиске
Яндекс открыл Alice AI-T5-35B-A0.6B - обученную с нуля собственную модель, на которой работают быстрые ответы Алисы в Поиске. Веса лежат на Hugging Face, а детали есть на Хабре. Вообще, компактных моделей, которые реально стоят под высокой "боевой" нагрузкой, в опенсорсе не так уж много, поэтому стоит глянуть детальнее.
Контекст такой: поиск - это наверное, самый массовый генеративный продукт вообще. В пике идут сотни тысяч (если не миллионы) запросов в минуту, и на каждый надо за пару секунд найти источники и документы/артефакты, вытащить из них полезное, фильтрануть мусор и собрать ответ. Большую LLM на такой поток не поставишь - долго и дорого, а тут вся конструкция заточена на скорость. Поэтому Яндекс сделал многоуровневую штуку:
Сначала небольшая BERT-подобная модель (это тип нейросетки, которая не генерит текст, а только читает и понимает его) на 80 млн параметров вырезает из найденных документов только нужные куски. Её обучили на 4 трлн токенов, а потом через RL (та самая, "дрессировка с подкреплением") научили оставлять минимум контекста - именно столько, сколько нужно генератору. Это делает вход короче, а пропускная способность увеличивается примерно на 40% без видимой потери качества.
Сам генератор - гибрид по типу Encoder-Decoder (хорошо переваривает длинный поисковый контекст), скрещённый с разреженным MoE, Mixture of Experts. MoE - это когда вместо одной большой нейросети, которая целиком обрабатывает каждое слово, несколько "маленьких подсетей-экспертов". А специальный маршрутизатор на каждом слове решает, каких из них подтянуть к ответу.
В этой модели 35 млрд параметров, но на каждом токене включается только 600 млн - менее 2%. В итоге получается, что по объёму знаний - как большая модель, а цена инференса - как у маленькой.
При масштабировании у команды коллапсировал роутинг в encoder-части. Проще говоря, в начале обучения какой-то "эксперт" случайно оказался чуть лучше, роутер стал отправлять к нему больше токенов, он от этого стал ещё лучше, роутер отправлял ещё чаще к нему, и получалась петля. Решили переходом на aux-free routing из DeepSeek-V3.
Но, наверно, самое необычное ("unfair advantage"), что модель дообучают не только на офлайн-разметке, но и на поведении реальных юзеров: сколько человек читал ответ, хватило ли ему, или он пошёл искать дальше. Из этих сигналов собрали реворд-модель (отдельную нейросеть, которая не пишет ответы, а оценивает их - условно "хорошо/плохо") и тоже засунули её в RL. В итоге модель научилась угадывать интент юзера: типа, на "баллы ЕГЭ английский" сразу выдаёт шкалу баллов, а не лекцию про устройство экзамена.
По бенчам: после одинакового элаймента Alice AI выигрывает 77% сравнений у Qwen 3.5 2B и 69% у T5 Gemma 2 4B. Более тяжёлой Qwen 3.5 35B-A3B уступает (44% побед), но заметно дешевле в инференсе. А продовая версия взяла 56,7% побед у Google AI Overview в слепом сравнении и дала статистически значимый рост числа сессий на пользователя.
Команду поздравляю, штука реально добротная получилась, судя по результатам. А главный вывод лично для меня - что всё больше веса приобретает обвязка вокруг самой модели. Поиск, экстрактор контекста, быстрая инфра (новомодный харнесс, короче) и главное - миллионы живых запросов с реальными поведенческими сигналами, на которых можно видеть суть запроса и попадать в интент. Причём это работает тоже как петля: чем больше людей пользуется поиском, тем лучше модель, тем больше людей пользуется, ... . Такой набор есть буквально у нескольких компаний в мире.
Дизраптор
Post #3855
13.8K
- 👍 105
- 🔥 33
- ❤ 22
- ⚡ 9
- 😁 7
- 👨💻 1