TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.37K subscribers
Post #2355 214

Forwarded from False Positive

Помните кейс LiteLLM?

Мы дропаем
OMCBench (Open Malicious-Code Benchmark) - бенчмарк оценки качества по обнаружению вредоносного кода:
- 3 языка: Python, JavaScript, TypeScript
- 400 вредоносных пакетов, 400 чистых из pypi/npm
- пофайловая LLM разметка, о которой говорили на OFFZONE прошлым летом
- Открытая лицензия, BSD-2

Открытые решения на нем набирают не больше 75% F1, выдавая ~50% False Positive результатов...

Те, кто уже нажал звездочку на гитхабе, могли заметить, что в таблице мы также анонсим MOLOT - нашу модель для решения этого класса задач. Ловите блогпост, а на подходе arxiv статья с подробностями про анализ графов вызовов бертами, LLM разметку и выкатку в prod!

Ждите дроп статьи в канале, stay tuned!
  • ❤ 1
More from @mlsecfeed
  1. Oct 1, 2026Девять лет назад я участвовал в необычных соревнованиях на Kaggle: нужно было делать adver…
  2. Sep 30, 2026Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточ…
  3. Sep 28, 2026Nvidia представила платформу безопасности с открытым исходным кодом, призванную предотврат…
  4. Sep 28, 2026За последние две недели слишком много новостей вокруг Jev, я решил собрать себе автообзор…
  5. Sep 27, 2026⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU Supersonic…
  6. Sep 26, 2026📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueS…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →