За взрывным ростом LLM моделей следует активный рост методов оптимизаций инференса моделей.
🫸🫷Исследователи из Yandex Research предложили новый способ сжатия нейросетей посредством комбинации инструментов AQLM и PV-tuning. Метод позволяет сократить расходы на вычислительные мощности до 8 (!) раз, при этом качество ответов не снижается благодаря упомянутому PV-tuning. Для справки: другие аналоги сейвят для тех же моделей от 59% до 90% качества, а здесь сохраняется в среднем 95%. Впечатляет.
🏎️ То есть LMM-модели теперь можно запускать не только на топовых видюхах, но и на обычных картах. И ответы они будут давать быстро, не теряя в качестве. Как итог, новый метод сжатия значительно сэкономит ресурсы компаний и исследователей, которые разрабатывают или внедряют собственные нейронки.
✅ Я все чаще и чаще имею дело с запуском LLM на железе и считаю этот результат от Яндекса очень прикладным т.к без эффективного сжатия на обычные карты уже ничего не влезает.
Post #935
6.45K

- 👍 41
- ❤ 2