Llama 2 часть 2
Из интересных технических моментов:
- Если в первой версии Llama не использовался модный нынче Multi-Query Attention (MQA), то во второй авторы пошли дальше и встроили новый Grouped Query Attention (если честно, в первый раз слышу про него). Отличие нового механизма внимания — в нём допускается несколько голов для Key & Value матриц, а не одна (MQA), и не то же число, что и у Query (classical attention). За счёт этого можно настроить trade-off между качеством модели и размером/скоростью инференса.
- Длина контекстного окна при обучении в два раза больше (4к токенов), чем у первой версии. Но это все равно не так впечатляет, как 8к и 32к у GPT-4 и 100к у Claude, хоть и не известно, на какой длине эти модели обучались большую часть претрейна.
- 2 триллиона токенов для моделей всех размеров, что оставляет все другие open-source модели, покушавшиеся на лавры Llama, нервно курить в сторонке.
- Для тренировки самой большой модели потратили примерно 1,7 миллионов часов работы Nvidia A100, что соответствует 35 дням непрерывной работы кластера из 2048 гпушек. Для сравнения, Falcon тренили на 384 карточках в AWS на протяжении двух месяцев.
- В этот раз нет описания использованных датасетов, только информация, что все данные — из публично доступных источников и не содержат данных пользователей продуктов Meta. Отсечка — по сентябрь 2022 года для базовых моделей.
- Для Supervised Fine Tuning (SFT) использовали всего 27540 примеров. Для Reward Modeling 1,4 миллиона сравнений, созданных с помощью самостоятельно, и ещё 1,5 миллиона опенсорсных. При этом они не выкладывают свой датасет😥
- Авторы используют сразу две reward модели — одну для Helpfulness и вторую для Safety.
- Также они придумали ещё одну штуку: GAtt (Ghost Attention). Её смысл в добавлении в диалоги с большим числом реплик изначальной инструкции в начало КАЖДОЙ реплики пользователя и дообучения модели на этих примерах. Видимо, похожим образом работает system message в API GPT-4.
В целом, несмотря на некоторые недостатки по сравнению с закрытыми моделями производства Google и OpenAI, Llama 2 выглядит новой вехой в истории LLM и open source, так как её, на мой взгляд, вполне можно будет использовать вместо платных API и файнтюнить сколько угодно.
Post #15
904
- 🔥 8
- 👍 2
- ❤ 1