TGViewer
notes.ml notes.ml @notesdotml · 159 subscribers
Post #31 242

Forwarded from False Positive

Читаем вместе. ИИ в AppSec: могут ли LLM работать с уязвимым кодом

[хабр-обзор] [папира]

Всем привет!

Решил расширить RG еще и на тексты Хабр, сделал разбор статьи LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks. В качестве затравки — несколько тезисов из разбора:

➡️ Результаты бенчмарка — «фотография во времени», быстро устаревающая не только по списку оцененных моделей, но и по попаданию данных в cut-off более современных LLM. Бенчмаркам на безопасность кода критически не хватает подходов по автоматическому обновлению на подобие SWE-rebench.

➡️ Очень зашли гипотезы про согласованность рассуждений и ответов, проверка на «пропатченном» коде и эксперименты с аугментацией.

➡️ Так, например, даже сильные модели ломаются на стресс-аугментациях, таких как изменения в уязвимом коде названий методов/переменных или добавление неиспользуемого кода.

➡️ Наглядная секция про техники промптинга. Практический вывод: роль-ориентированные инструкции и пошаговый CoT заметно улучшают качество (особенно в zero-shot). Но при наличии few-shot инструкций импакт от CoT снижается. Это может помочь сэкономить контекста в некоторых задачах.

➡️ Ограничение длины контекста в реальных кейсах играет критическую роль, поскольку код, приводящий к уязвимости, может находиться не только в разных частях файла, но и в разных частях проекта. Тут стоит отойти от академических статей и посмотреть на инженерные подходы к отбору контекста разработчиками Cursor, Claude-code и прочих копайлотов для разработки.
__________________

Макс Митрофанов, ML-лид направления AppSec 🟥
  • 🔥 1
More from @notesdotml
  1. Sep 20, 2026Заметка достаточно настоялась, нашел силы причесать 🫠 Итак, таймлайн: - AppSec 1.0 - проц…
  2. Sep 20, 2026Смена парадигмы безопасной разработки в эпоху software 3.0 Часть 5 - AppSec 3.0, сингулярн…
  3. Aug 19, 2026Как понять, что конфа годная? У тебя нет билета, но доклады на посмотреть копятся сами соб…
  4. Jul 25, 2026photo post
  5. Jul 25, 2026Сегодня наша команда держала стенд на технохабе Сбера, активность по ML System Design в ИБ…
  6. Jul 16, 2026Так, блог-заметки по MOLOT'у подоспели, го читать и лайкать: - ru - eng
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →