Llama 2
Исследователь нашей лаборатории ИИ Андрей Аргаткин прочитал статью про новую Llama 2 и готов поделиться своими наблюдениями.
Вышла новая версия условно опенсорсной Llama. На сей раз, кажется, использовать модель можно действительно открыто всем, в том числе и коммерческим компаниям.
Несколько прозаических фактов, показавшихся мне интересными:
- Скачать просто так всё равно пока (?) нельзя, необходимо заполнять форму на сайте, а затем на сайте HF, если планируется скачивать веса с их платформы. Обещают рассматривать за 1-2 суток🙄
Принимая во внимание скорость рассмотрения заявок на доступ к Llama 1, надеюсь, что эту досадную формальность уберут, и не нужно будет искать ссылку на торрент.
- Обучили 4 модели таких же размеров, как и в прошлой версии (7B, 13B, 34B и 70B), но версию на 34B скачать пока не дадут — говорят, что недостаточно протестили её (lack of time to sufficiently red team в оригинале).
- Для каждого размера Meta выпустила 2 модели — Llama 2 и Llama 2 Chat с файнтюнингом, red teaming и RLHF, и непонятно, зачем не открывать обычную модель на 34B, которая даже не была заалайнена.
- Самая большая модель ожидаемо бьёт опенсорсные модели и своего предшественника и по всем «объективным» бенчмаркам в незаалайненном виде (MMLU, Big Bench Hard, MATH и прочие), и по «субъективным» в заалайненном (safety and helpfulness by humans & GPT-4 judge).
- Однако актуальные коммерческие модели (GPT-3.5, GPT-4 и PaLM-2) всё равно лучше на объективных бенчмарках. Тем не менее, Llama 2 либо лучше, либо несущественно отстаёт от PaLM-1, и это очень круто!
Теперь в наших руках есть модель не хуже, чем лучшая LLM образца середины прошлого года, и для инференса которой не нужен свой дата-центр🤗
О том, чем ещё интересна модель, в следующем посте.
Post #12
831
- 🔥 11