Яндекс выложил веса модели, которая пишет быстрые ответы Алисы в Поиске. Первый поисковик, открывший модель из продакшена нейроответов: AliceAI-T5-35B-A0.6B, претрейн без дообучения на инструкциях, Apache 2.0.
Архитектура encoder-decoder с MoE, у крупных открытых моделей такая почти не встречается: 0,6 млрд активных из 35, 512 экспертов в слое и 8 на токен, контекст 128K. Обучали с нуля на 15 трлн токенов с оптимизатором Muon и балансировкой экспертов из DeepSeek-V3: схема со вспомогательным лоссом на таком объёме данных коллапсировала в энкодере. По среднему баллу модель рядом с Qwen 3.5 4B, по скорости генерации почти вдвое быстрее Qwen 3.5 35B-A3B. Сильнее всего на фактологии и длинном контексте, на математике и коде уступает Qwen.
Рядом с моделью работает BERT-экстрактор на 80 млн параметров: он вырезает из найденных документов только нужные генератору куски, и за счёт короткого входа Поиск отвечает примерно на 40% большему числу запросов на тех же мощностях. Устройство всей цепочки разобрали на Хабре, веса и пример дообучения через LoRA лежат на Hugging Face.
@neuro_channel
Post #2885
2.02K

- ❤ 6
- 👍 5
- 👀 1