На свежую голову я решил разобраться в чем дело и почему нейронка использует мало GPU. (Смотрим на зеленый график)
Я заметил тенденцию, что когда нейронка анализирует промпт, то она грузит карту на 100%, а отвечает уже на расслабоне. Меня осенило! Чем больше промт, тем больше контекста она анализирует и в этот момент она использует все возможные ресурсы GPU для анализа. А потом в ответе уже на расслабоне отвечает.
Post #117
165

- ⚡ 3
- 👍 3
- ❤🔥 1