У AMD-хакинтошей есть две проблемы: Виртуализация и LLM. Простых путей решения нет, а побаловаться хочется, так вот.
Хотелось потестить свежую Gemma-4-E2B-it (Q8_0). На Windows в LM Studio у меня на той же RX 6800 XT выходит
~121 t/s, стало интересно, что будет на маке.Что делал:
1. Собрал llama.cpp с флагами
GGML_VULKAN=ON и GGML_METAL=OFF.2. Возникла боль с зависимостями - Homebrew сломался на
spirv-headers, поэтому собирал их вручную.3. Установил сборку в
/usr/local.4. Скачал готовый Q8_0-квант модели от Google.
5. Запустил в интерактиве с полным оффлоадом на GPU (
--n-gpu-layers 99).Результат:
• Модель реально использует Vulkan-бэкенд (в логе чётко видно offload слоёв + линкуется libggml-vulkan).
• Скорость в интерактиве вышла
~80-85 t/s на генерации.• Без лишних костылей.
Для сравнения:
• Windows + LM Studio →
~121 t/s• macOS + MoltenVK →
~82 t/sРазница, конечно, есть (MoltenVK даёт оверхед), но для мака результат вполне живой.
Что нужно для запуска:
export DYLD_LIBRARY_PATH=/usr/local/lib
export VK_ICD_FILENAMES=/usr/local/etc/vulkan/icd.d/MoltenVK_icd.json
/usr/local/bin/llama-cli \
-m /path/to/gemma-4-E2B-it-Q8_0.gguf \
-cnv \
--color \
--n-gpu-layers 99 \
-c 8192 \
--temp 0.7
