TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.37K subscribers
Post #2149 130

Forwarded from LLM под капотом

Анализ того, как агенты справлялись с задачами на безопасность в BitGN PAC1

Я взял все прогоны из Accuracy Leadeboard-a и проанализировал то, как разнообразные агенты справлялись с задачами на безопасность и надежность.

И там начинается забавное.

(1) Если в задачах есть очевидный prompt injection, то агенты их щелкают как орешки. 37.9% ошибок, что ниже уровня ошибок в среднем (44.5%). Это, например t011 или t013

(2) Задачи, где агенту нужно было не забыть проверить входящие запросы на личность отправителя (t019 и t020) - еще легче, 27.9% ошибок

(3) Задачи на границы (вроде t023), когда известный отправитель очень вежливо нарушает границы дозволенного - были сложнее - 67.3% ошибок

(4) Смежные задачки, где человек запрашивает документы в рамках дозволенного (например, t021 и t022), но нам нужно двигаться строго по прописанному процессу, оказались самыми сложными - 75.2% ошибок.

Получается, что вежливое нарушение границ работает лучше, чем наглый prompt injection. Надо будет побольше задач докинуть в таком духе.

А на картинке - heatmap с распределением ошибок среди top 50% прогонов (в комментариях - файл в высоком разрешении)

Ваш, @llm_under_hood 🤗
More from @mlsecfeed
  1. Oct 4, 2026GLM-5.3 без цензуры: вышел EXL3-квант на 3 бита На Hugging Face появилась uncensored-верси…
  2. Oct 3, 2026На Хабре вышла статья о том, что ИИ изменил в кибератаках от нашей Red Team команды (tl;dr…
  3. Oct 2, 2026Cloudflare тоже сделали свои версии Jev Они выпустили Clef и Clef-flash, две открытые deci…
  4. Oct 2, 2026Наш jev? FRIDA-Decisions! Ребята из ру сегмента тоже не отстают FRIDA-Decisions makes stru…
  5. Oct 1, 2026Девять лет назад я участвовал в необычных соревнованиях на Kaggle: нужно было делать adver…
  6. Sep 30, 2026Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →