TGViewer
Вездесущий ИИ | Лучшие нейросети Вездесущий ИИ | Лучшие нейросети @ii_papka · 2.7K subscribers
Post #1004 577
🧠 Инференс, префилл, кванты — что за взрыв мозга и зачем это знать?

Можно купить компьютер за полмиллиона, загрузить нейросеть и обнаружить, что модель влезла, а ждать ответ несколько часов (если запрос хотя бы чуть-чуть был сложный)

Собрал перевод с ИИшного на человеческий ⬇️


1. Inference, prefill, decode — что происходит после запроса
— Инференс — работа уже обученной модели: отправили запрос → получили результат
— Префилл — обработка входных данных: промта, переписки, документов. Условно модель читает пачку бумаг перед ответом (смотрят на то, какой там объем токенов)
— Декодинг — генерация продолжения, токен за токеном. Токен — кусочек текста: слово, часть слова или знак. Префилл и декодинг по-разному нагружают железо — объяснение NVIDIA

2. TTFT и tok/s — почему быстрая модель тормозит
— TTFT — время до первого токена. В него могут входить очередь, сеть и обработка запроса — документация NVIDIA
— tok/s — токены в секунду. Всегда уточнять: скорость обработки входа, генерации одного ответа или суммарная производительность сервера
— Reasoning — дополнительные шаги рассуждения модели. Это тоже генерация, а не префилл; если рассуждения скрыты, до видимого ответа придётся ждать дольше
Пример: 1 000 токенов при 50 tok/s — около 20 секунд генерации. Но если до ответа прошла минута, вся задача заняла примерно 80 секунд (из которых минута — размышления)

3. Параметры и квантизация — сколько места нужно модели
— 70B — 70 миллиардов параметров: числовых настроек, полученных при обучении
Квантизация — хранение чисел с меньшей точностью. FP16 — 16 бит, Q8 — примерно 8, Q4 — примерно 4. Памяти нужно меньше, качество может измениться — документация Hugging Face
— Арифметика для 70B: 140 ГБ при 16 битах или 35 ГБ при 4 битах. Это только веса, без служебных данных и памяти для работы

4. Контекст и KV cache — куда исчезает свободная память
— Контекстное окно — сколько токенов модель может учитывать в одном запросе, включая место под продолжение
— KV cache — сохранённые промежуточные расчёты внимания: помогают не пересчитывать прошлые токены заново. Длиннее диалог и больше одновременных запросов → обычно больше расход памяти — как работает кеш

5. Dense, MoE и bandwidth — почему размер не равен скорости
— Dense — при обработке токена задействуется основная масса параметров модели
— MoE — модель с блоками экспертов: для каждого токена выбирается часть из них. Вычислений меньше, но веса остальных экспертов всё равно нужно где-то хранить — разбор Hugging Face
— Bandwidth — пропускная способность памяти, в ГБ/с. Объём памяти определяет, что поместится; её скорость часто ограничивает генерацию при одиночном запросе

👍 — наконец понял, сохраняю словарь

🪐 Вездесущий ИИ | Чат с админом | Консультация
More from @ii_papka
  1. Sep 24, 2026🥾 Разгоняем тяжелую модель в 2–2.5 раза через спекулятивный декодинг Берем основную рабоч…
  2. Sep 24, 2026Сидите на бесплатной версии AI и думаете, что вам хватит? Проверьте себя по четырём пункта…
  3. Sep 23, 2026⚡️ Как ускорить локальный ИИ в 2–3 раза без покупки новой видеокарты Стандартный GGUF — ме…
  4. Sep 22, 2026🐈 Нейроморфные процессоры — Loihi от Intel Labs. Что это за демон? АРХИТЕКТУРА СЕЙЧАС ⬇️…
  5. Sep 21, 2026💻 Codex Remote — лучшая фича за последние годы Оставил ноут / комп включенным, подключил…
  6. Sep 20, 2026🧑‍🎓 Рассматриваешь курс по ИИ? Это какой-то бред ... Зачем тратить деньги на то, что дос…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →