SecCodeBench-V2 Technical Report
Вышел технический отчет по новой версии бенчмарка SecCodeBench-V2, предназначенного для оценки того, насколько безопасный код пишут LLM.
98 сценариев генерации и исправления кода, взятых из кейсов Alibaba. 5 языков: Java, C, Python, Go и JavaScript.
Решение проверяется через динамическое исполнение и специально написанные экспертами PoC-тесты. Также используется LLM as a judge.
https://arxiv.org/pdf/2602.15485
Post #1490
571