Если совсем по-человечески, то идея этой модельки такая: она читает текст как поток и держит отдельную маленькую “долгую память” для важных событий, вместо того чтобы таскать за собой весь предыдущий текст как обычные attention-модели.
Поиск идёт не по точной позиции в тексте, а по смысловому ключу. Поэтому модель может вспомнить запись далеко после того, как она появилась.
Основная проблема сейчас уже не “как запомнить”, а “как правильно выдать ответ наружу”. То есть нужное событие часто внутри находится, но старый способ превращать найденное значение в нормальный токен модели был слабым.
делаю...
🦆🦆🦆
Поддержать канал ₽ / $ / ₿
Post #4672
1.58K
- ❤ 20
- 🔥 11
- 👍 8
- 🕊 1