Ant Group представила Ling-3.1-Flash — новую крупную MoE-модель семейства Ling, ориентированную прежде всего на ИИ-агентов, программирование и длительные многошаговые задачи. Модель получила около 560 млрд параметров, но при обработке каждого токена активирует примерно 25 млрд, что позволяет сочетать большую общую ёмкость с более умеренными вычислительными затратами.
Ling-3.1-Flash поддерживает гибридный режим рассуждений, вызов инструментов и работу с длинным контекстом. Максимальное заявленное окно составляет 1 млн токенов, хотя во время бесплатного запуска доступно 256K. В размещённой у Novita версии также указан максимальный ответ до 32K токенов. Разработчики отдельно оптимизировали модель для универсальных агентов, поиска, офисных задач и разработки ПО, а также улучшали её возможности в медицине, финансах и исследованиях материалов.
По опубликованным вместе с релизом результатам Ling-3.1-Flash набирает 1673 Elo в GDPVal-AA v2.1, 75,16 в FrontierSWE и 65,35 в HealthBench Professional. Эти цифры выглядят особенно интересно для модели класса Flash, однако пока это результаты, распространяемые вместе с анонсом: полноценные независимые тесты новой версии ещё практически отсутствуют. В частности, агрегаторы, уже добавившие модель, пока не выставили ей собственные оценки качества.
По сравнению с Ling-3.0-Flash масштаб модели вырос очень сильно: предыдущая версия имела около 124 млрд параметров и активировала примерно 5,1 млрд, тогда как теперь это 560 млрд и 25 млрд соответственно. То есть название Flash здесь уже означает скорее экономичность за счёт разреженной MoE-архитектуры, чем небольшую модель.
Сейчас Ling-3.1-Flash запускают с двухнедельным бесплатным доступом и ограничением контекста до 256K. После завершения бесплатного периода разработчики планируют перейти к платному API, открыть полный контекст на 1 млн токенов и одновременно опубликовать веса модели. Таким образом, Ling-3.1-Flash пока выглядит как попытка Ant Group перенести уровень крупной флагманской MoE-модели в сегмент быстрых агентных моделей — особенно для программирования, поиска и работы с большими объёмами контекста.
Post #1375
75
