TGViewer
ML — это ОК ML — это ОК @mlvok · 2.1K subscribers
Post #15 904
Llama 2 часть 2

Из интересных технических моментов:
- Если в первой версии Llama не использовался модный нынче Multi-Query Attention (MQA), то во второй авторы пошли дальше и встроили новый Grouped Query Attention (если честно, в первый раз слышу про него). Отличие нового механизма внимания — в нём допускается несколько голов для Key & Value матриц, а не одна (MQA), и не то же число, что и у Query (classical attention). За счёт этого можно настроить trade-off между качеством модели и размером/скоростью инференса.

- Длина контекстного окна при обучении в два раза больше (4к токенов), чем у первой версии. Но это все равно не так впечатляет, как 8к и 32к у GPT-4 и 100к у Claude, хоть и не известно, на какой длине эти модели обучались большую часть претрейна.

- 2 триллиона токенов для моделей всех размеров, что оставляет все другие open-source модели, покушавшиеся на лавры Llama, нервно курить в сторонке.

- Для тренировки самой большой модели потратили примерно 1,7 миллионов часов работы Nvidia A100, что соответствует 35 дням непрерывной работы кластера из 2048 гпушек. Для сравнения, Falcon тренили на 384 карточках в AWS на протяжении двух месяцев.

- В этот раз нет описания использованных датасетов, только информация, что все данные — из публично доступных источников и не содержат данных пользователей продуктов Meta. Отсечка — по сентябрь 2022 года для базовых моделей.

- Для Supervised Fine Tuning (SFT) использовали всего 27540 примеров. Для Reward Modeling 1,4 миллиона сравнений, созданных с помощью самостоятельно, и ещё 1,5 миллиона опенсорсных. При этом они не выкладывают свой датасет😥

- Авторы используют сразу две reward модели — одну для Helpfulness и вторую для Safety.

- Также они придумали ещё одну штуку: GAtt (Ghost Attention). Её смысл в добавлении в диалоги с большим числом реплик изначальной инструкции в начало КАЖДОЙ реплики пользователя и дообучения модели на этих примерах. Видимо, похожим образом работает system message в API GPT-4.

В целом, несмотря на некоторые недостатки по сравнению с закрытыми моделями производства Google и OpenAI, Llama 2 выглядит новой вехой в истории LLM и open source, так как её, на мой взгляд, вполне можно будет использовать вместо платных API и файнтюнить сколько угодно.
  • 🔥 8
  • 👍 2
  • ❤ 1
More from @mlvok
  1. Dec 18, 2025Пришло время для SilverTorch! Сегодня на ридинг-группе — фреймворк, который бросает вызов…
  2. Dec 16, 2025В этот раз в рамках ридинг-группы обсудим SilverTorch — фреймворк, нацеленный на упрощение…
  3. Dec 4, 2025📢 Осталось 10 минут до ридинг-группы! Поговорим о том, как Taobao через RecGPT переосмысл…
  4. Dec 2, 2025На ближайшей ридинг-группе 4 декабря обсудим RecGPT — подход Taobao к пересборке классичес…
  5. Nov 24, 2025🔹Поделились записью ридинг-группы от 20 ноября в AI VK Hub — обсудили, как Spotify адапти…
  6. Nov 20, 2025📢 До начала ридинг-группы осталось 10 минут! Поговорим, как Spotify превращает контекст в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →