Рабочие заметки ML инженера
Автор: @m1trm
Post #43
264
notes.ml Появятся закрытые бенчмарки, на которые станут опираться вендоры для продвижения своих AI-first продуктов
Wiz опубликовали AI Cyber Model Arena.
Промежуточные результаты:
Готов поспорить на бокал светлого, что в этом году Wiz (Самый дорогой кибербез стартап ever, который в 2025 купил гугл) после публикации закрытого бенчмарка попытаются попасть в него с собственным решением.
Исходя из костов на реализацию, я предполагаю, что они выложат своего агента, который будет соперничать с внешними вендорами, но закрытые модели будут не их (на лидерборде поделили фильтрацию по агентам и моделям).
Но возможно они удивят всех, выложив в 2026 и агента, и модель.
Место тех репорта на лендинге арены еще пустует, в общем следим 👀
Промежуточные результаты:
One central takeaway from the results is that offensive capability is jointly determined: the same model can swing dramatically depending on the agent scaffold, and performance is highly domain-specific. No single pairing dominates across all categories-even when one combination leads in most of them.
Готов поспорить на бокал светлого, что в этом году Wiz (Самый дорогой кибербез стартап ever, который в 2025 купил гугл) после публикации закрытого бенчмарка попытаются попасть в него с собственным решением.
Исходя из костов на реализацию, я предполагаю, что они выложат своего агента, который будет соперничать с внешними вендорами, но закрытые модели будут не их (на лидерборде поделили фильтрацию по агентам и моделям).
Но возможно они удивят всех, выложив в 2026 и агента, и модель.
Место тех репорта на лендинге арены еще пустует, в общем следим 👀






