Mistral представила Large 4 — лидера независимого теста по кибербезопасности
6 октября вышло публичное превью Mistral Large 4 («Le Chonk»). Внутри — 1,05 трлн параметров, из которых на каждый токен задействуется около 49 млрд. Модель понимает текст и изображения; Mistral заявляет контекст до 1 млн токенов.
Главный результат подтвердил независимый оценщик Artificial Analysis: 81,7% в CyberGym-E2E-AA — первое место среди 18 протестированных моделей. В этом тесте агент ищет ошибки безопасности в C/C++-проектах, воспроизводит сбой и готовит исправление, которое сохраняет прохождение тестов.
Ещё Mistral сообщает о 93% на Cybench — наборе из 40 задач соревнований по кибербезопасности. Это результат, опубликованный самой компанией.
Что показывают остальные независимые рейтинги?
• В общем AA Cyber Index у Large 4 — 50 баллов, а у MiMo-V2.6-Pro — 56. Поэтому называть её лучшей во всей кибербезопасности нельзя.
• В AA Intelligence Index — 38 баллов, столько же, сколько у GPT-6 Luna в режиме max.
• В Vals Index — 48,05% и 32-е место из 44. В тесте разработки приложений Vibe Code Bench v1.1 — 78,4% и 25-е место из 109.
Сейчас модель можно попробовать через API. Открытые веса обещают к концу октября; на официальной странице Hugging Face ожидаемая дата — 31 октября. Пока скачать их нельзя.
Анонс Mistral · Независимый разбор AA · Будущий релиз весов
#апдейтымоделей #кибербезопасность #исследования
Post #740
376
- 👍 2