TGViewer
gonzo-обзоры ML статей gonzo-обзоры ML статей @gonzo_ml · 24.5K subscribers
Post #1407 4.71K
[Stanford] Alpaca: A Strong, Replicable Instruction-Following Model
Rohan Taori, Ishaan Gulrajani, Tianyi Zhang, Yann Dubois, Xuechen Li, Carlos Guestrin, Percy Liang, Tatsunori B. Hashimoto
Статья: https://crfm.stanford.edu/2023/03/13/alpaca.html
Repo: https://github.com/tatsu-lab/stanford_alpaca

Новости полу-опенсорсного мира. С тех пор как полу-опубликовали LLaMA (https://t.me/gonzo_ML/1324) и она утекла на торренты (https://t.me/gonzo_ML/1346), с моделью произошло много всего интересного. Её научились квантовать в 4 бита и запускать из плюсов на ноутбуке (https://github.com/ggerganov/llama.cpp), на телефоне Pixel 6 (https://twitter.com/thiteanish/status/1635188333705043969), а Артём Андреенко запихнул её на Raspberry Pi 4 с 4GB RAM (https://twitter.com/miolini/status/1634982361757790209).

В это время исследователи из Стэнфорда взяли LLaMA 7B и затюнили её на instruction-following, полученную модель назвали Alpaca. Инструкции -- это запросы типа "Give me a cooking recipe for the following food.", "Given the name of an exercise, explain how to do it.", "Analyze the sentences below to identify biases." и т.п и соответствующие им ответы.

Датасет из 52k демонстраций следования инструкциям сгенерили через OpenAI GPT-3 (text-davinci-003, то есть обычная GPT-3.5, не ChatGPT или GPT-4) пользуясь подходом Self-Instruct (https://arxiv.org/abs/2212.10560), что есть красивый бутстрап.

Для этого начали со 175 написанных человеком примеров из работы Self-Instruct (https://github.com/yizhongw/self-instruct/blob/main/data/seed_tasks.jsonl). Их использовали как in-context примеры (внутри промптов) для GPT-3 и нагеренили ещё больше инструкций (те самые 52k уникальных инструкций и соответствующих ответов). Данные довольно разнообразны, см. красивую картинку с круговой диаграммой. На это потратили меньше $500 на апишку OpenAI. Так понимаю, с ChatGPT потратили бы вообще $50.

Имея этот датасет из 52k примеров, зафайнтюнили LLaMA через HuggingFace transformers Trainer, пользуясь из коробки техниками типа fully sharded data darallel и mixed precision training. Их начальный запуск файнтюнинга 7B LLaMA модели потребовал порядка трёх часов на 8 GPU A100-80GB, что по нынешним ценам облака стоит меньше $100 (ну на Амазоне чуть больше, https://aws.amazon.com/ec2/instance-types/p4/).

На датасете для оценки показали, что модель демонстрирует поведения похожие на генерального прокурора text-davinci-003, будучи при этом сильно меньше.

Авторы зарелизили код для обучения, данные (те самые 52k примеров) и код для их генерации. Веса обученной модели пока не релизили, но собираются (если авторы LLaMA не будут против). Модель подняли и сделали доступной через демку здесь https://crfm.stanford.edu/alpaca/

Модель оставили “only for academic research” с запретом любого коммерческого использования, потому что, во-первых, LLaMA с такой лицензией и надо её наследовать, во-вторых, данные сгенерированы с помощью модели OpenAI, а их Terms of Service запрещает разработку моделей, конкурирующих с OpenAI, ну и, в-третьих, в безопасность модели сильно не вкладывались, так что тоже стрёмно.

Авторы упирают на то, что этот подход годен для академии, не обладающей большими ресурсами, как индустрия. По мне, что важно, это не менее годно для энтузиастов и стартапов, хотя тут есть какие-то риски касательно моделей.

LLaMA могла бы официально стать аналогом BERT’а по импакту на индустрию, но не станет из-за своей лицензии и не очень открытости. Может, конечно, станет подпольно (и будет продаваться на дисках на Митинском рынке), а может какой-то новый GPT-J или кто-то иной возьмёт себе этот бэдж. Независимо от этого, уже второй большой ImageNet-moment в NLP произошёл благодаря всем этим свежим GPT, с чем всех и поздравляю.
GitHub GitHub - tatsu-lab/stanford_alpaca: Code and documentation to train Stanford's Alpaca models, and generate the data. Code and documentation to train Stanford's Alpaca models, and generate the data. - tatsu-lab/stanford_alpaca
  • 🔥 24
  • ❤ 11
  • 👍 9
  • 😁 1
More from @gonzo_ml
  1. Oct 1, 2026photo post
  2. Oct 1, 2026photo post
  3. Oct 1, 2026Ещё свежая математическая статья про динамику оптимизации и важность факторизации матриц в…
  4. Sep 30, 2026Post #6055
  5. Sep 30, 2026photo post
  6. Sep 30, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →