Llama 3: новое поколение одной из самых популярных языковых моделей от Meta*
18 апреля компания Meta выпустила третью версию языковой модели Llama. Модель доступна в двух размерах – 8 и 70 миллиардов параметров. Максимальная длина текста, который модели Llama 3 могут обработать за раз, составляет 8192 токенов (токен – часть слова или целое слово). Это на порядки меньше, чем могут обработать GPT-4 (128 тысяч токенов), Gemini (один миллион токенов) и многие другие современные модели.
Обе версии доступны для коммерческого использования. Однако если у компании больше 700 миллионов активных пользователей в месяц и она хочет использовать Llama 3, она вынуждена запросить разрешение на использование у Meta.
Меньшая модель была обучена на выборке с 15-ю триллионами токенов: для сравнения, Llama 2 обучали на выборке в 7.5 раз меньше. За счёт этого в ряде основных тестов модель превосходит все доступные модели близкого размера, включая Mistral (модель французского стартапа, который основан бывшими сотрудниками Meta, участвовавшими в создании первой версии Llama) и Gemma от Google.
Версия Llama 3 с 70-ю миллиардами параметров в большинстве тестов по качеству лучше Google Gemini и Cohere Claude Sonnet, одних из лидирующих коммерческих моделей на данный момент.
По многочисленным оценкам пользователей платформы LMSYS, где каждый желающий может сравнить ответы двух разных моделей, Llama 3 на английском языке уступает лишь GPT-4, текущему лидеру рейтинга.
Также в процессе обучения Llama 3 с 400 миллиардами параметров. Её релиз состоится позже, однако уже сейчас по метрикам она сравнима с GPT-4.
*Компания Meta признана экстремистской в России, ее деятельность запрещена
🤖 «Системный Блокъ» @sysblok
Post #903
3.84K
- ❤ 15
- 🔥 8
- 👍 4