🔍 В чате мне написали коллеги, что Yandex занимается тоже энкодер-декодер нейросетями, но это не аналог Causal Encoder-Decoder (CED) у DeepSeek-V4.1-Flash, а это копия очень старой, но живой архитектуры Google T5, которая впервые была опубликована американцами в статье «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer» в 2019 году.
Однако архитектура живая, хотя и нишевая. Аналогом AliceAI-T5-35B-A0.6B является тут Google t5gemma-2-4b-4b. Такие нейросети применяют Encoder на BERT, который не понимает причинно-следственных связей полностью и часто реагирует на вопрос как на «мешок слов». У DeepSeek энкодеры называются Causal Encoder именно потому, что там маскированное внимание как у классических трансформеров, поэтому там энкодер понимает уже сложные причинно-следственные связи.
Архитектура T5 тем не менее может работать для поисковых запросов, но почти всегда потребуется вам дообучать модель для эффективного использования. Однако они маленькие. Хотя dense-модель у Google тут выигрывает по простоте создания LoRA, поэтому они и не стали делать MoE как Yandex. Поскольку LoRA часто не сделать для MoE вообще, то у Yandex скорее надо хитрить промптами через ICL.
Реальные сценарии обычно:
🔹 Маршрутизация запросов (Query Routing). Иными словами, у вас N поисковых агентов по темам, а T5 решает, кому откинуть запрос.
🔹 Переформулирование запроса (Query Rewriting). Например, юзер пишет запрос обычным языком, а модель переводит в SQL или язык запроса к вашему API.
Хотя LoRA по модели Yandex сделать затруднительно из-за MoE, но благодаря ему модель даёт экстремально низкую нагрузку на кластер из GPU.
UPDATE. У Сбера вроде есть SberDevices FRED-T5. Надо посмотреть.
https://huggingface.co/yandex/AliceAI-T5-35B-A0.6B
https://huggingface.co/google/t5gemma-2-4b-4b
Post #5201
3.04K

- ✍ 11
- ❤ 4
- 👍 2