⚡️ WORLD INTEL BRIEF
• 🔬 Сравнение пяти квантованных моделей на ноутбуке с 6-ГБ GPU опровергло исходный вывод о превосходстве WasmEdge над llama.cpp в 2–9 раз: сборка llama.cpp фактически работала только на CPU, хотя журнал сообщал о полной выгрузке на GPU. После включения GPU обработка промпта ускорилась в 17–20 раз, а генерация — лишь в 1,4–1,7 раза. Zenodo
↳ Журнал выполнения не гарантирует, что локальный инференс действительно использует GPU.
—
📡 @azalio_tech_summary
Post #9800
25