Можно купить компьютер за полмиллиона, загрузить нейросеть и обнаружить, что модель влезла, а ждать ответ несколько часов (если запрос хотя бы чуть-чуть был сложный)
Собрал перевод с ИИшного на человеческий ⬇️
1. Inference, prefill, decode — что происходит после запроса
— Инференс — работа уже обученной модели: отправили запрос → получили результат
— Префилл — обработка входных данных: промта, переписки, документов. Условно модель читает пачку бумаг перед ответом (смотрят на то, какой там объем токенов)
— Декодинг — генерация продолжения, токен за токеном. Токен — кусочек текста: слово, часть слова или знак. Префилл и декодинг по-разному нагружают железо — объяснение NVIDIA
2. TTFT и tok/s — почему быстрая модель тормозит
— TTFT — время до первого токена. В него могут входить очередь, сеть и обработка запроса — документация NVIDIA
— tok/s — токены в секунду. Всегда уточнять: скорость обработки входа, генерации одного ответа или суммарная производительность сервера
— Reasoning — дополнительные шаги рассуждения модели. Это тоже генерация, а не префилл; если рассуждения скрыты, до видимого ответа придётся ждать дольше
Пример: 1 000 токенов при 50 tok/s — около 20 секунд генерации. Но если до ответа прошла минута, вся задача заняла примерно 80 секунд (из которых минута — размышления)
3. Параметры и квантизация — сколько места нужно модели
— 70B — 70 миллиардов параметров: числовых настроек, полученных при обучении
Квантизация — хранение чисел с меньшей точностью. FP16 — 16 бит, Q8 — примерно 8, Q4 — примерно 4. Памяти нужно меньше, качество может измениться — документация Hugging Face
— Арифметика для 70B: 140 ГБ при 16 битах или 35 ГБ при 4 битах. Это только веса, без служебных данных и памяти для работы
4. Контекст и KV cache — куда исчезает свободная память
— Контекстное окно — сколько токенов модель может учитывать в одном запросе, включая место под продолжение
— KV cache — сохранённые промежуточные расчёты внимания: помогают не пересчитывать прошлые токены заново. Длиннее диалог и больше одновременных запросов → обычно больше расход памяти — как работает кеш
5. Dense, MoE и bandwidth — почему размер не равен скорости
— Dense — при обработке токена задействуется основная масса параметров модели
— MoE — модель с блоками экспертов: для каждого токена выбирается часть из них. Вычислений меньше, но веса остальных экспертов всё равно нужно где-то хранить — разбор Hugging Face
— Bandwidth — пропускная способность памяти, в ГБ/с. Объём памяти определяет, что поместится; её скорость часто ограничивает генерацию при одиночном запросе
👍 — наконец понял, сохраняю словарь
🪐 Вездесущий ИИ | Чат с админом | Консультация
