✍ Cross-Lingual Jailbreak Detection via Semantic Codebooks — Ширин Аланова, магистрантка AI Talent Hub, ITMO University & HiveTraceLab
Большинство защитных фильтров LLM заточены под английский. Переведи вредоносный запрос на русский, арабский или китайский — и фильтр может просто не среагировать.
Ширин и команда проверили, реально ли ловить такие атаки без дообучения модели. Идея простая: сравнивать семантическую близость входящего запроса с набором известных английских джейлбрейков через мультиязычные эмбеддинги BGE-M3 и косинусное сходство. Протестировали на четырёх языках, нескольких бенчмарках и разных моделях — Qwen, Llama, GPT-3.5. Результаты получились неоднородные: на одних типах атак метод держится стабильно, на других проседает.
✍ Cascading Failures in Multi-Agent LLM Systems —
Вера Краснобаева, магистрантка AI Talent Hub, ITMO University & AI Security Lab
OWASP включил каскадные ошибки в мультиагентных LLM-системах в топ-10 рисков агентных систем. При этом открытых инструментов для их изучения почти не существовало — ни воспроизводимых пайплайнов, ни нормальных исследований.
Вера взяла OWASP-проект FinBot и начала строить на его основе мультиагентную архитектуру: четыре агента в линейной цепочке — Validator, Risk Analyzer, Approval и Payment Processor. Первые же эксперименты показали два сценария, в которых возникают каскады: грязные входные данные и неверные суждения самих агентов. Заодно получилась таксономия каскадных ошибок.
Дальше работа доросла до контрибьюта в OWASP. Вера подхватила мультиагентную архитектуру, которую к тому времени начали набрасывать сами разработчики FinBot, доделала агентов и замапила их на роли в каскадном пайплайне. Теперь в портале FinBot есть отдельный Cascade Lab — с живой демонстрацией того, как каскадные ошибки работают на реальном пайплайне.
AINL — одна из ключевых академических конференций по NLP и AI в России.
Полную информацию об исследованиях, можно будет прочитать осенью 🔜 cледите за новостями
⚡️ — если поддерживаешь спикеров
❤️— если хочешь также