Mistral AI представила публичное превью своей флагманской модели нового поколения — Mistral Large 4 (ML4, получившей шутливое кодовое имя «le Chonk»). Модель создана с упором на концепцию цифрового суверенитета и обучена с нуля на европейской инфраструктуре Mistral, включающей 3800 графических процессоров NVIDIA Grace Blackwell. Архитектурно она представляет собой нативно мультимодальную смесь экспертов (MoE) с общим объемом в 1 триллион параметров, из которых при инференсе активно задействуются 49 миллиардов. Модель поддерживает работу с более чем 160 языками, объединяет инструкции, сложное рассуждение и агентные сценарии, а ее открытые веса планируется опубликовать к концу месяца. До официального релиза весов компания проводит редтиминг и тестирование с доверенными партнерами и регуляторами, при этом предварительная версия уже доступна через API в Mistral Studio по цене 1,36 доллара за миллион входных токенов и 4,18 доллара за миллион выходных.
Ключевым преимуществом ML4 разработчики называют передовой уровень возможностей в прикладных и корпоративных областях, прежде всего в кибербезопасности. В профильных бенчмарках модель занимает лидирующие позиции среди систем с открытыми весами и превосходит ряд закрытых аналогов благодаря способности воспроизводить уязвимости, реверс-инжинирить вредоносный код и предлагать исправления без чрезмерных блокировок со стороны защитных фильтров, оставаясь при этом защищенной от непрямых промпт-инъекций и несанкционированного джейлбрейка. Параллельно демонстрируются высокие результаты в агентном написании кода, работе с терминалом, комплексном анализе документов, юриспруденции, финансах и естественно-научных расчетах, включая возможность генерации сложных химических и физических симуляций.
В области мультимодальности модель получила существенный скачок точности пространственного сопоставления (visual grounding), что позволяет эффективно анализировать масштабные спутниковые снимки, сложные технические чертежи и схемы для инженерных и производственных нужд. Достигнутые результаты опираются на масштабируемый процесс обучения с подкреплением (RL), объединяющий десятки тысяч параллельных сред с кодовыми песочницами и внешними API. Разработчики подчеркивают, что запуск ML4 стал первым практическим шагом в реализации планов после привлечения инвестиционного раунда серии D объемом 3 миллиарда евро, а текущая модель послужит фундаментом для целой линейки специализированных отраслевых решений.
Post #1388
180

- 👍 1