Забыла написать про пост от HF про Falcon – The Falcon has landed in the Hugging Face ecosystem
https://huggingface.co/blog/falcon
Найти в нем можно много интересного:
1. Оказывается, >80% датасета для Falcon составляет RefinedWeb (почищенные накрауленные данные из интернета). Успех модели на лидербордах авторы приписывают очень хорошему пофильтрованному датасету, поэтому я ждала, что они как-то хитро проверяли источники и стиль текстов, классифицировали их по куче параметров и так далее. На деле фильтрация там очень минималистичная – жестко вычищали дубликаты, спам, ссылки, бойлерплейт (типа html-вставок) и просто рандом. Но семантический анализ текста там целенаправленно не делали, что для меня довольно удивительно. Guanaco от OpenAssisant например вычищали через валидацию кучи разметчиков. Кстати кусок на 600B токенов из RefinedWeb авторы выложили на HF
2. Еще из приятного HF там рассказывает про свой Text Generation Inference server – контейнер, соптимизированный для сервинга больших моделей (на нем же сервится их HuggingChat). Поддерживает сейчас LLaMA, FLAN-t5, Falcon и в теории все, что можно запихнуть в AutoModelForSeq2SeqLM
3. Выложили код, как потюнить Falcon 7B с использованием QLoRa, в том числе как запихнуть это обучение в колаб
Post #952
2.01K
я обучала одну модель Возвращаюсь после небольшого перерыва и сразу с овервью еще одной модели Falcon LLM - Основная модель размером 40B, тренировалась на 1T токенов (это все еще меньше, чем 1.4T у LLAMA). Есть версия и на 7B - Инференс ускоряли через Flash-Attention и Multi-query…
- 🔥 5
- ❤ 3