TGViewer
SOF_news SOF_news @sof_news24 · 309 subscribers
Post #1999 39
🇩🇪🤖 Германия: Aleph Alpha открыла веса собственной модели Kolibri
Немецкая Aleph Alpha представила Kolibri-1 – новую языковую модель, разработанную с нуля с упором на немецкий и английский языки, работу с документами, программирование и ИИ-агентов. Веса опубликованы под Apache 2.0.
🔻 Kolibri построена по разреженной схеме MoE: всего 78,1 млрд параметров, однако при обработке одного токена используются только 3,46 млрд – около 4,4%. Модель содержит 50 слоёв.
⚙️ Для снижения затрат на длинном контексте Aleph Alpha применила гибридное внимание. Только 10 из 50 слоёв работают со всем накопленным текстом, остальные 40 учитывают окно примерно в 512 предыдущих токенов. Таким образом, при увеличении истории далеко не каждый слой вынужден повторно просматривать весь документ.
📌 Нативный контекст составляет 262 тыс. токенов. Предобучение велось на последовательностях 16 тыс. токенов, следующий этап – на 64 тыс., заключительный – на 256 тыс. Благодаря особенностям позиционного кодирования модель может работать и дальше этой границы; разработчики проверили её на 1 048 576 токенах, однако для сложных задач рекомендуют не превышать 262 тыс.
Модель прошла около 24 трлн токенов обучения: 20 трлн на основном этапе, 3,44 трлн – на промежуточном и ещё около 200 млрд – при расширении контекста. Основное обучение заняло 21 сутки на 768 ускорителях Nvidia B200. Для последующего обучения с подкреплением подготовлено более 1,2 млн задач, включая программирование, рассуждения и применение программных инструментов.
🔻 Kolibri поддерживает вызов инструментов и четыре режима рассуждения – none, low, medium и high. Разработчики прямо ориентируют её на RAG, обработку документов и построение ИИ-агентов.
📊 По актуальной карточке модели: AIME 2025 – 95,8%, GPQA Diamond – 84,8%, SWE-bench Verified – 69,2%. Последний показатель ниже Qwen3.5 35B-A3B – 71,6% и Qwen3.6 35B-A3B – 73,8%. При этом средний результат немецкоязычных тестов у Kolibri составляет 71,0% против 69,8% у Qwen3.5 и 70,2% у GPT-OSS 120B. Абсолютным лидером она не является: Qwen3.8 27B получает 79,9%.
Основное значение Kolibri – появление у Германии собственной современной базовой модели, полностью обученной европейской компанией, с открытыми весами, сильным немецким языком и сравнительно небольшим объёмом вычислений на каждый токен. Для локальных корпоративных RAG-систем и ИИ-агентов это потенциально более интересная особенность, чем сами 78 млрд параметров.
💾 Официальный FP8 занимает около 79 ГБ; также опубликована BF16-версия примерно на 156 ГБ. Уже появилась сторонняя GGUF Q4_K_M размером 47,5 ГБ, но это неофициальная конверсия, и её поддержка в стандартном llama.cpp пока требует отдельного патча.
🔗 Kolibri-1 – Hugging Face
More from @sof_news24
  1. Oct 5, 2026🇺🇦🇩🇪 Украина / Германия: расширение военно-промышленного сотрудничества Федеральный ка…
  2. Oct 5, 2026🇹🇷🛡 Турция: €2,46 млрд на новые зенитные ракетно-пушечные комплексы Турецкая компания «…
  3. Oct 5, 2026🇺🇸👤⚙️ США: особенности выдвижения Дэвида Филлипса на высшую военную должность в системе…
  4. Oct 5, 2026🇮🇹⚔️ 5–25 октября – Италия. Учение ВМС «Маре Аперто – 2026/2» В Центральном Средиземномо…
  5. Oct 4, 2026🧭 Военный календарь на 5 октября 2026 года Ежедневно – основные заранее объявленные мероп…
  6. Oct 4, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →