Вопрос не в том, «потянет ли видеокарта модель», а в том, что станет узким местом после загрузки.
Рынок сейчас:
• NVIDIA — максимум bandwidth
• Apple — максимум памяти
• Strix Halo — интересный x86 с unified memory
• Tenstorrent — open-source стек
Но после загрузки модели начинают решать KV-cache, декодирование, батчинг и качество софта.
Локальный AI сегодня — это не про гигабайты памяти. Это про баланс памяти, скорости и программного стека.
⛓️ Ссылка на источник
tags: #полезное
➡ Data Scientist | Чат
