🤖🗜 Мы уже рассказали, как компании пытаются найти энергию для нейросетей. Теперь разбираемся, как они делают нейросети более экономичными.
Экономия ресурсов на обучении
Одно из самых популярных решений в этом направлении — метод Full Sharded Data Parallel (FSDP). Он распределяет параметры моделей между несколькими графическими процессорами, уменьшая потребление памяти и ускоряя обучение.
Недавно Яндекс выпустил YaFSDP — оптимизированную версию FSDP, которая даёт ускорение до 25% и позволяет использовать на 20% меньше ресурсов GPU. По схожему принципу работает и DeepSpeed — библиотека оптимизации глубокого обучения, разработанная Microsoft.
Сжатие моделей
Один из главных методов — дистилляция знаний. Он предполагает передачу знаний от крупной модели-учителя к более легковесной модели-ученику: вторая пытается воспроизвести поведение первой при тех же входящих данных. При этом качество работы младшей модели остаётся близким к оригиналу, а скорость работы возрастает в разы.
Также широко применяется квантизация — техника, позволяющая закодировать веса моделей меньшим количеством бит. Так можно уменьшить размер модели и ускорить её работу почти без ущерба для качества ответов. Существуют разные способы квантизации, например разработанные исследователями Яндекса совместно с Институтом науки и технологий Австрии (ISTA) методы SpQR, AQLM и PV-tuning.
Ещё один метод — прунинг. Он уменьшает расход памяти и объём вычисления за счёт устранения части параметров в модели. Существует два способа прунинга: неструктурированный и структурированный. Первый подразумевает обнуление отдельных весов и создание разреженной матрицы, второй — удаление целых групп весов.
Насколько всё это эффективно?
Один из параметров, по которым можно оценить экономичность модели, — это стоимость токена, отражающая затраты на обработку текста той или иной моделью. Стоимость токена стремительно снижается. Например, обработка миллиона токенов GPT-4 в марте 2023 года стоила $30. Сегодня основная модель OpenAI — GPT-4o — выполняет эту работу всего за $2,5, при этом качество ответов у неё гораздо выше, чем у GPT-4.
⭐️ Если у вас оформлен Telegram Premium, поддержите наш канал по ссылке
Подписывайтесь 👉 @techno_yandex
Post #3130
32.2K

- ❤ 89
- 👍 68
- 🔥 20
- 🤯 2
- 🥱 1