llama.cpp — это C++ имплементация инференса для LLM моделей семейства Llama от Meta, оптимизированная для работы на обычных компьютерах. Проект примечателен своей эффективностью и минималистичным подходом к коду.
Ключевые особенности:
• Написан на чистом C/C++ без зависимостей
• Поддерживает количественную 4/5/8-битную квантизацию весов
• Использует SIMD инструкции (AVX2, AVX-512) для ускорения вычислений
• Потребляет минимум памяти благодаря эффективному управлению ресурсами
👉 Github
Post #5317
4.37K

- 👍 13