Мое на 1 трлн параметров, 49б активных
Инфа от Клода
Бенчмарки (цифры заявила Mistral; часть взята из независимых рейтингов Artificial Analysis и vals.ai)
DeepSWE v1.1: 61.7%
SWE-Atlas-QnA: 59.4%
Terminal-Bench 4: 28.3%
Coding Agent Index: 49.8%, выше DeepSeek V4 Pro и Qwen3.8 Max
Слепая оценка кода людьми (Surge AI): 2-е место из 5 моделей, 3.74 балла. Впереди только Claude Opus 5 (4.22), позади Kimi K3 и GLM-5.3.
AutomationBench (657 бизнес-сценариев в Gmail, Sheets, Slack, Salesforce): 59.9%
AA-Briefcase (долгая офисная работа): 1393 Elo
Кибербезопасность: топ-5 в мире по AA Cyber Index, Cybench 93%, задача «воспроизвести уязвимость и закрыть её» 82%. По последней Mistral заявляет лучший результат среди всех моделей. Объясняют это тем, что Claude Opus 5.5 и GPT-6 Astra там почти на нуле, потому что просто отказываются выполнять задание.
Зрение: Dense 200 42% против 41% у GPT-6-Astra
Юридические и финансовые задачи (оценка vals.ai): выше GPT-6-Astra. На Legal Agent от Harvey лучше всех open-source моделей.
Безопасность: отбивает 93.3% атак на Lakera B3 (защита от prompt injection, то есть скрытых вредных инструкций в данных), KORA Benchmark 1.691 из 2.
Цитаты с оффицального анонса
"ML4 is a 1 trillion-parameter natively multimodal model with 49 billion active parameters. It is our largest and most capable model to date"
(«ML4 — нативно мультимодальная модель на 1 триллион параметров, из них 49 миллиардов активных. Это наша самая большая и самая сильная модель на сегодня».)
"ML4 pushes the frontier of open-weight performance."
(«ML4 двигает вперёд границу возможностей открытых моделей».)
"significantly outperforming any open-weight model developed in the US or Europe"
(«заметно превосходит любую открытую модель, сделанную в США или Европе».)
"On critical enterprise workloads, including cybersecurity, finance and law, we find it to be state-of-the-art among open models."
(«В важных корпоративных задачах, включая кибербезопасность, финансы и право, она лучшая среди открытых моделей».)
"In some domains such as visual grounding, it goes further still, surpassing even frontier closed models."
(«В некоторых областях, например в визуальном распознавании объектов, она обходит даже топовые закрытые модели».)
Бля перечислять дальше насколько их новая модель пиздата я не могу, по их словам мы лучшие, а вы все лохи, почитать можно тут
Цена
Вход: $1.36 / €1.21 1M
Выход: $4.18 / €3.73 1M
Веса планируют скинуть в конце этого месяца, неофициально 27 октября