TGViewer
ТЕХНО: Яндекс про технологии ТЕХНО: Яндекс про технологии @techno_yandex · 224K subscribers
Post #3130 32.2K
🤖🗜 Мы уже рассказали, как компании пытаются найти энергию для нейросетей. Теперь разбираемся, как они делают нейросети более экономичными.

Экономия ресурсов на обучении
Одно из самых популярных решений в этом направлении — метод Full Sharded Data Parallel (FSDP). Он распределяет параметры моделей между несколькими графическими процессорами, уменьшая потребление памяти и ускоряя обучение.

Недавно Яндекс выпустил YaFSDP — оптимизированную версию FSDP, которая даёт ускорение до 25% и позволяет использовать на 20% меньше ресурсов GPU. По схожему принципу работает и DeepSpeed ​​— библиотека оптимизации глубокого обучения, разработанная Microsoft.

Сжатие моделей
Один из главных методов — дистилляция знаний. Он предполагает передачу знаний от крупной модели-учителя к более легковесной модели-ученику: вторая пытается воспроизвести поведение первой при тех же входящих данных. При этом качество работы младшей модели остаётся близким к оригиналу, а скорость работы возрастает в разы.

Также широко применяется квантизация — техника, позволяющая закодировать веса моделей меньшим количеством бит. Так можно уменьшить размер модели и ускорить её работу почти без ущерба для качества ответов. Существуют разные способы квантизации, например разработанные исследователями Яндекса совместно с Институтом науки и технологий Австрии (ISTA) методы SpQR, AQLM и PV-tuning.

Ещё один метод — прунинг. Он уменьшает расход памяти и объём вычисления за счёт устранения части параметров в модели. Существует два способа прунинга: неструктурированный и структурированный. Первый подразумевает обнуление отдельных весов и создание разреженной матрицы, второй — удаление целых групп весов.

Насколько всё это эффективно?
Один из параметров, по которым можно оценить экономичность модели, — это стоимость токена, отражающая затраты на обработку текста той или иной моделью. Стоимость токена стремительно снижается. Например, обработка миллиона токенов GPT-4 в марте 2023 года стоила $30. Сегодня основная модель OpenAI — GPT-4o — выполняет эту работу всего за $2,5, при этом качество ответов у неё гораздо выше, чем у GPT-4.

⭐️ Если у вас оформлен Telegram Premium, поддержите наш канал по ссылке

Подписывайтесь 👉 @techno_yandex
  • ❤ 89
  • 👍 68
  • 🔥 20
  • 🤯 2
  • 🥱 1
More from @techno_yandex
  1. Sep 29, 2026Скачать файл в формате .djvu Если эта надпись вызывает у вас негативные эмоции, то винить…
  2. Sep 29, 2026🔴 А что, если мечтать — это не наивность, а первый шаг к будущему? Иногда взрослым сложно…
  3. Sep 29, 2026🔍 означает «найти», 💾 — «сохранить», а ✨ всё чаще подразумевает «пусть ИИ сделает за мен…
  4. Sep 28, 2026В Китае мать погибшего геймера через суд получила право на 87 его игровых аккаунтов. В Инд…
  5. Sep 28, 2026🤖 ИИ может начать разгонять сам себя Такой сценарий уже вызывает беспокойство даже у сами…
  6. Sep 28, 2026Технолоджия #14 Разбираемся, зачем Microsoft снова перестраивает Xbox, сможет ли Googleboo…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →