Помните, мы переводили статью про кэширование промптов? Сегодня подготовили перевод от того же автора — на этот раз про квантизацию. Тот же стиль: интерактивная визуализация, объяснение базы, которая лежит в основе и всё это простыми словами.
Для тех, кто слышит про квантизацию впервые: квантизация — это способ уменьшить размер модели, заменив
16- или 32-битные числа с плавающей запятой на целые числа меньшего размера.За счёт этого модели на 160 ГБ могут поместиться на обычный ноутбук и даже работать быстрее!
Главный инсайт от автора:
Когда я только захотел написать эту статью, я ничего не знал о квантизации. Я предполагал, что качество модели деградирует линейно по мере сжатия. То есть8-битная квантизацияbfloat16будет вдвое хуже, затем4-битная вдвое хуже8-битной, и так далее.
Это оказалось не так.
Переход с16-битной до8-битной квантизации несёт почти нулевые потери качества. Переход с16-битной до4-битной более заметен, но это точно не «в четыре раза хуже оригинала». Ближе к 90%, в зависимости от метрики.
Не бойтесь запускать локальные квантизованные модели.
Понимание того, как модели устроены изнутри, напрямую влияет на то, насколько хорошо вы их используете. Поэтому считаем такие статьи must have для senior vibecoder 😉
📚 Читайте и комментируйте на Хабр.
@ai_for_devs