Немецкая Aleph Alpha представила Kolibri-1 – новую языковую модель, разработанную с нуля с упором на немецкий и английский языки, работу с документами, программирование и ИИ-агентов. Веса опубликованы под Apache 2.0.
🔻 Kolibri построена по разреженной схеме MoE: всего 78,1 млрд параметров, однако при обработке одного токена используются только 3,46 млрд – около 4,4%. Модель содержит 50 слоёв.
⚙️ Для снижения затрат на длинном контексте Aleph Alpha применила гибридное внимание. Только 10 из 50 слоёв работают со всем накопленным текстом, остальные 40 учитывают окно примерно в 512 предыдущих токенов. Таким образом, при увеличении истории далеко не каждый слой вынужден повторно просматривать весь документ.
📌 Нативный контекст составляет 262 тыс. токенов. Предобучение велось на последовательностях 16 тыс. токенов, следующий этап – на 64 тыс., заключительный – на 256 тыс. Благодаря особенностям позиционного кодирования модель может работать и дальше этой границы; разработчики проверили её на 1 048 576 токенах, однако для сложных задач рекомендуют не превышать 262 тыс.
Модель прошла около 24 трлн токенов обучения: 20 трлн на основном этапе, 3,44 трлн – на промежуточном и ещё около 200 млрд – при расширении контекста. Основное обучение заняло 21 сутки на 768 ускорителях Nvidia B200. Для последующего обучения с подкреплением подготовлено более 1,2 млн задач, включая программирование, рассуждения и применение программных инструментов.
🔻 Kolibri поддерживает вызов инструментов и четыре режима рассуждения – none, low, medium и high. Разработчики прямо ориентируют её на RAG, обработку документов и построение ИИ-агентов.
📊 По актуальной карточке модели: AIME 2025 – 95,8%, GPQA Diamond – 84,8%, SWE-bench Verified – 69,2%. Последний показатель ниже Qwen3.5 35B-A3B – 71,6% и Qwen3.6 35B-A3B – 73,8%. При этом средний результат немецкоязычных тестов у Kolibri составляет 71,0% против 69,8% у Qwen3.5 и 70,2% у GPT-OSS 120B. Абсолютным лидером она не является: Qwen3.8 27B получает 79,9%.
Основное значение Kolibri – появление у Германии собственной современной базовой модели, полностью обученной европейской компанией, с открытыми весами, сильным немецким языком и сравнительно небольшим объёмом вычислений на каждый токен. Для локальных корпоративных RAG-систем и ИИ-агентов это потенциально более интересная особенность, чем сами 78 млрд параметров.
💾 Официальный FP8 занимает около 79 ГБ; также опубликована BF16-версия примерно на 156 ГБ. Уже появилась сторонняя GGUF Q4_K_M размером 47,5 ГБ, но это неофициальная конверсия, и её поддержка в стандартном
llama.cpp пока требует отдельного патча.🔗 Kolibri-1 – Hugging Face
