📊 Модели впервые перехватили поток управления в бинарных уязвимостях
Anthropic Frontier Red Team оценила несколько моделей на 100 случайных задачах из внутреннего набора тестов Binary Exploitation. GLM-5.3 довела атаку до полного перехвата потока управления в 4% случаев, Claude Mythos Preview — в 6%. Предыдущие модели Claude Opus 4.6 и GLM-5.2 не добились ни одного успеха.
Перехват потока управления — это не просто нахождение уязвимости, а полноценное её использование: модель превращает повреждение памяти в выполнение собственного кода. Раньше LLM могли находить ошибки, но не доводили цепочку эксплуатации до конца. Теперь на сотне задач появились воспроизводимые успехи — порог пересечён.
Набор тестов внутренний, деталей о сложности задач и окружении нет. По данным Simon Willison, выборка случайная, но прямого сравнения с публичными наборами данных не будет. Для российских команд, работающих с анализом бинарных уязвимостей, это сигнал: допущение, что LLM не доводят эксплуатацию до конца, больше не работает.
Четыре и шесть процентов на сотне задач выглядят скромно, но раньше модели давали ровно ноль. Переход от неспособности к воспроизводимому успеху — качественный скачок, который важнее любых цифр на MMLU.
#GLM5 #ClaudeMythos #BinaryExploitation #AIsecurity #Anthropic
Post #306
4