Сегодня Яндекс анонсировал новое поколение языковых моделей YandexGPT 5, и мне было бы совсем неинтересно обсуждать очередную версию LLM, если бы не некоторые детали. Например, компания вернулась к публикации моделей в опенсорс впервые с 2022 года, подробнее об этом ниже
Начнём с YandexGPT 5 Pro. При её создании команда пошла по пути оптимизации процесса обучения. Улучшили датасет, добавив больше сложных и разнообразных примеров. Внедрили собственную модификацию DPO (LogDPO) для борьбы с эффектом «разучивания». Применили метод гибридного обучения, добавив базовые настройки открытой модели Qwen. А благодаря оптимизации процесса с помощью YaFSDP удалось снизить потребность в вычислительных ресурсах на 25%
А вот YandexGPT 5 Lite компания выложила в открытый доступ. Pretrain-версия прошла двухэтапное обучение: сначала на 15T токенах русско- и англоязычных текстов, затем этап Powerup на 320B токенов высококачественных данных
В общем, ещё одно подтверждение, что индустрия движется к большей открытости. В такой системе успешными становятся те, кто умеет сочетать собственные технологии с открытыми решениями, создавая более эффективные продукты и ускоряя общий прогресс в области ИИ
Post #1365
3.1K
- 👍 5
- ❤ 2
- 🔥 1