Команда Olmo представила Olmo-core 3 — открытую масштабируемую инфраструктуру для обучения больших MoE-моделей
Команда Olmo выпустила Olmo-core 3 — открытую инфраструктуру для обучения больших языковых моделей с архитектурой «смесь экспертов» (MoE). Система рассчитана на модели с триллионом параметров и помогает сохранять высокую скорость обучения: в одном тесте число экспертов выросло с 8 до 128, а пропускная способность снизилась менее чем на 5%. В другой проверке модель на 47 млрд параметров обрабатывала 52 000 токенов в секунду на каждом из восьми ускорителей NVIDIA B300 — примерно в 2,7 раза быстрее прежней реализации. Olmo-core 3 станет основой следующего поколения Olmo, которое будет построено на MoE.
👉 Читать полностью
Post #7797
6