Microsoft MDASH обходит Mythos и GPT-5.5
#microsoft #anthropic #mythps #openai #gpt #cybergym
Microsoft выкатила MDASH — Multi-model Agentic Scanning Harness, и это интереснее обычной новости про «ещё один AI для безопасности». На публичном **CyberGym система набрала **88,45% и вышла на первое место: выше Claude Mythos Preview от Anthropic с 83,1% и GPT-5.5 от OpenAI с 81,8%.
Главная деталь: MDASH не пытается победить всех одной моделью. Microsoft собрала инженерный конвейер из 100+ специализированных агентов: одни строят карту кода и поверхности атаки, другие ищут подозрительные пути, отдельная группа спорит о достижимости и эксплуатации, затем находки дедуплицируются и доказываются через PoC-входы. Это ближе к автоматизированной команде исследователей безопасности, чем к «сканеру на LLM».
Почему CyberGym важен? Это не набор синтетических задач. Бенчмарк UC Berkeley содержит 1507 реальных задач по воспроизведению уязвимостей из 188 OSS-Fuzz-проектов. Агент получает описание уязвимости и уязвимую кодовую базу, а успех засчитывается только если он строит рабочий PoC, который падает на vulnerable-версии и не падает после патча. То есть измеряется не красивое объяснение бага, а способность довести гипотезу до воспроизводимого результата.
Самый сильный вывод из MDASH: преимущество смещается от "какая модель умнее" к "какая система умеет ставить модели в правильные роли". Microsoft отдельно пишет, что результат получен на общедоступных моделях. Значит, разрыв создала не магическая закрытая модель, а оркестрация: индексация, threat modeling, debate-stage, доказательство, доменные плагины и повторяемая валидация.
Хотя лично мне тейк про мы запустило 100+ агентов и оно разъебало давно понятен. Имея ∞ ресурсов конечно можно позволить себе запустить такую ораву агентов. Хочется увидеть уже хоть какую-то оптимизацию процессов без критичного ущерба в качестве, скорости и повторяемости нахождения уязвимостей, хотя на в white box режиме. Сейчас к этому стремятся как будто только Китайцы, а ИИ рынок США чахнет в своих выдуманных миллионах, миллиардах и триллионов долларов.
Хотя я не отрицаю пользу мультиагентной системы в контексте того, что есть группа агентов, которая намеренно душнит других, чтобы те явно доказывали работоспособность PoC, а не делали уверенный вид что это PoC и он якобы проходит E2E проверки
🌚 @poxek_ai / Чат канала
Post #2310
180
Forwarded from Похек AI (Сергей Зыбнев)
- 🤝 2
- 🔥 1