Сегодня наш амбассадор Ruslan Dev подготовил для вас интересный пост про Qwen 2.5 Max. Разбираем особенности модели, бенчмарки и возможности использования.
📢 Разбор от Ruslan Dev:
Как оказалось, есть желающие использовать отлично показавший себя подход DeepSeek и создавать LLM на базе MoE архитектуры с помощью reinforcement-learning и последующего SFT-файнтюнинга. Так появилась Qwen 2.5 Max от Alibaba Cloud. Веса этой модели еще не выложены в открытый доступ, однако есть результаты бенчмарков, демо и доступ через чат, а также по API.
📌 Подробнее — в официальной статье разработчика.
Также известно, что модель была обучена на корпусе из 20 триллионов токенов, то есть на пять триллионов больше, чем Llama 3 и DeepSeek V3. На части бенчмарков Qwen 2.5 Max превосходит или очень близка к DeepSeek V3, GPT-4o, и Claude-3.5-Sonnet.
Неизвестно, сколько у Qwen 2.5 Max параметров. Вполне возможно, что Alibaba просто пошли по пути масштабирования модели с той же архитектурой, что и DeepSeek V3.
Последнюю я запускал на immers.cloud, используя 4-bit квантизацию - чтобы выгрузить все слои на GPU, необходимо пять видеокарт H100 (аренда стартует от 456,27 ₽/час). Таким образом, модели такого класса все еще малодоступны для большинства пользователей.
🚀 Запускайте H100 для своих задач и решений!
@ruslandevlive — мысли о современных AI/ML-технологиях
