Команда Yandex Research разработала новый метод квантизации LLM с помощью комбинации AQLM и PV-tuning. Научная статья о способах сжатия была включена в программу конференции ICML 2024.
Технология позволяет уменьшить размер больших языковых моделей в 8 раз, сохраняя при этом качество ответов в среднем на 95%
Это означает, что компании и организации во всем мире смогут сократить расходы на вычислительные мощности до 8 раз. Станет возможным запускать LLM на обычных устройствах, таких как умные колонки и смартфоны.
Новый подход позволяет запускать на обычных видеокартах LLM, которые ранее требовали мощных графических процессоров. При этом модели будут давать качественные ответы с высокой скоростью.
Это открывает возможности для компаний, стартапов и исследователей, работающих с генеративными нейросетями. Разработанные Яндексом методы помогут внедрить LLM в различные продукты и сервисы, делая нейросети более доступными для всех.
Post #732
4.04K

- 👍 7
- 🤔 3
- ❤ 1
- 🔥 1