Дифузионнки для текста
Пару месяцев назад gemini анонсировало gemini diffusion - первую дифузионную текстовую модель, которая по метрикам относительно близка к обычным LLM (и то и то трансформер, но один авторегерессионный а другой - дифузионный)
Как она работает
Обычная ллмка последовательно, токен за токеном генерирует последовательность. На запрос LLM(Какая сталица франции) результатом будет распределение вероятности следующего токена из которого сразу выберется самый вероятный кандидат
Gemini diffusion работает немного подругому. Вместо того что бы сразу определяться с токеном, она "постепенно" расшумляет его распределение вероятности. То есть на выходе из модели так же распределения вероятностей токенов, но мы не семплируем output сразу, а много раз вызываем одну и ту же модель, подавая output i го шага как вход i+1
И только после этого семплируем токен.
Такой подход позваляет генерировать не "токен за токеном", а сразу "разшумлять" весь ответ ллмки, так что скорости генерации таких моделей получаются ошеломительные
Post #177
2.37K

- 👍 9
- 🔥 8
- ❤ 5