Falcon 180B — самая мощная open source LLM?
Когда команда Technology Innovation Institute из ОАЭ выпустила Falcon 180B, их разработку быстро включили в топы языковых моделей с открытым исходным кодом и наделили громкими титулами вроде того, что мы вынесли в заголовок.
🔜 Разбираемся, что всех так поразило
🔵 180B в названии модели — это 180 billion, то есть 180 миллиардов параметров. Больше, чем у LLaMA 2, но меньше PaLM-2 от Google, на которой работает Bard.
🔵 Falcon 180B натренировали на 3,5 триллионах токенов (у LLaMA — 2 трлн) преимущественно на датасете RefinedWeb. Материал собрали из открытых источников отфильтровали и дедуплицировали, чтобы убрать все, что может повредить обучению модели: спам, дубликаты данных, бессмысленные тексты и наборы символов.
🔵 Falcon 180B мощнее LLaMA 2 и ChatGPT 3,5 и держится на уровне PaLM-2. Доказательства — в публикации на Hugging Face.
👀 А какие ограничения?
🔵 Falcon 180B «говорит» на английском, немецком, французском и испанском. Ограниченно может общаться на чешском, португальском, итальянском, польском, голландском и шведском. Выдающиеся результаты на других языках авторы не гарантируют.
🔵 Модель требовательна к ресурсам — ей понадобится на меньше 320 ГБ памяти.
На Hugging Face доступны два варианта для скачивания: Falcon 180B и Falcon 180B Chat. Первая предполагает использование после файнтюнинга на данных юзера, вторая уже натренирована на ведение разговора на естественном языке. А если скачивать не хочется и вообще вам только спросить, можно пообщаться с демкой.
Post #1184
33.8K

- 👍 12
- ❤ 4
- ⚡ 4
- 😍 1