🌟 AQLM․rs: сокращаем расходы на нейросети
Исследователь Яндекса разработал сервис для запуска языковых моделей с 8 млрд параметров на пользовательских девайсах.
Автор написал инференс модели Llama 3.1 8B, работающий в браузере на WebAssembly без использования GPU. Для этого он применил технологию сжатия нейросетей AQLM, которую разработала команда Yandex Research вместе с университетами ISTA и KAUST.
Для примера, скорость ответов нейросети на MacBook Pro M1 составила 1,5 токена в секунду или 3–4 символа.
🟡Статья
🖥Github
@ai_machinelearning_big_data
#AI #ML #LLM
Post #1396
4.13K

- 👍 11
- 🔥 3
- ❤ 2