Привет, редтимеры! 🚩
🏁 Закончилась Kaggle-сорева от OpenAI про атаки на LLM-агентов, и закончилась жестко - 2855 из 4252 команд получили 0 на привате. 😱
Соревнование было достаточно странным, с косяками от оргов, которые пловину времени соревы чинили косяки скореров и пр. и закончилось тоже странно.
На public главный рабочий приём был простой: заставить агента вызвать http.post и передать в data скоринговый маркер SECRET_MARKER. Меняешь URL, получаешь новые очки к скору, ускоряешь вызовы - растёшь в таблице.
Но на private этот путь умер 🪦. Похоже, скрытая проверка начала смотреть не только на URL, но и на содержимое data. Увидела SECRET_MARKER - заблокировала вызов вместе с очками скора. 😎
Самый сильный public-подход оказался самым хрупким.
Что выжило?
Более скучная, но устойчивая атака: CONFUSED_DEPUTY через email.send. Смысл в том, что пользователь явно не просит отправлять письмо, а агент всё равно сам вызывает отправку. На public это давало меньше очков, поэтому выглядело слабее. Зато на private почти не просело.
У топов это выглядело так:
123.730 public -> 0.000 private на exfil
34.630 public -> 34.510 private на confused deputy
Главная ошибка многих команд: выбрать два лучших public-сабмита.
Золотое правило Kaggle опять сработало - выбирай две разные ставки:
1. один быстрый http.post под public;
2. один отдельный email.send под private - для подстраховки.
🧠 Вывод
Месяц оптимизации, сотни сабмитов, красивые графики и 0.000 по итогу.
Впечатления странные, вместо соревнования про атаки на агентов с инструментами большую часть времени приходилось бороться со скорером и ускорением инференса, чтобы успеть больше очков залутать.
Но окончание веселое - в духе каггла
Кто участвовал? Какие результаты, как впечатления?
Post #900
1.17K
