Кстати всякие оптимизации аттеншена, типа Flash Attention и Multi-Query Attention и не только, неплохо описаны в этой статье (которую я честно увидела в DL in NLP)
https://medium.com/gopenai/how-to-speed-up-llms-and-use-100k-context-window-all-tricks-in-one-place-ffd40577b4c
Post #948
2.79K
я обучала одну модель Возвращаюсь после небольшого перерыва и сразу с овервью еще одной модели Falcon LLM - Основная модель размером 40B, тренировалась на 1T токенов (это все еще меньше, чем 1.4T у LLAMA). Есть версия и на 7B - Инференс ускоряли через Flash-Attention и Multi-query…Telegram DL in NLP Как LLMs могут принимать сразу 100К токенов на вход? Недавно несколько компаний объявили о возможности своих LLMs брать на вход аж до 100K токенов. Это промпт размером с книгу! Для примера, OpenAI GPT-4 может брать 8-32K, а опен-сорсные модели всего 2K.…
- 👍 5
- ❤ 2