✔️ IFM представил K2 Horizon - шесть открытых моделей от 0,9B до 375B
Линейка Institute of Foundation Models охватывает задачи от работы на устройствах до рассуждений, программирования и AI-агентов.
По заявлению IFM, для каждой модели публикуются веса, код обучения, конфигурации, данные или подробные рецепты их подготовки, промежуточные чекпоинты, логи и оценки качества. Материалы охватывают путь от предобучения до обучения рассуждениям и агентным задачам.
Основные детали:
* Около 20 трлн токенов на модель. В обучающей смеси - веб, код, математика, научные, многоязычные и синтетические данные.
* Около 17% корпуса содержат явные цепочки рассуждений. По данным IFM, при предобучении использовали примерно 10 трлн синтетических токенов.
* Более 100 млн уникальных задач подготовлены для постобучения. Открывается пайплайн SFT, объединения моделей, RL и специализированного обучения агентов.
* 36B-A4B активирует около 4 млрд параметров на токен. Архитектура Mixture-of-Value Attention переносит маршрутизацию экспертов в механизм внимания. По оценкам авторов, модель приближается к плотной 32B, обученной в сопоставимых условиях.
Для версий 0,9B, 3,7B и 7B IFM заявляет лучшие результаты в своих размерных категориях.
Также команда выпускает инфраструктуру обучения xLLM. Один из датасетов предобучения, TxT360-v2 объёмом 5,3 ТБ, опубликован на Hugging Face.
https://huggingface.co/datasets/IFM/TxT360-v2
Post #2997
3.28K

- ❤ 9
- 🔥 5
- 👍 3
- 🤣 1