TGViewer
AI Security Lab AI Security Lab @aisecuritylab · 2.22K subscribers
Post #225 2.25K
Две статьи ребят из нашей лаборатории вошли в программу AINL 2026

✍ Cross-Lingual Jailbreak Detection via Semantic Codebooks — Ширин Аланова, магистрантка AI Talent Hub, ITMO University & HiveTraceLab

Большинство защитных фильтров LLM заточены под английский. Переведи вредоносный запрос на русский, арабский или китайский — и фильтр может просто не среагировать.

Ширин и команда проверили, реально ли ловить такие атаки без дообучения модели. Идея простая: сравнивать семантическую близость входящего запроса с набором известных английских джейлбрейков через мультиязычные эмбеддинги BGE-M3 и косинусное сходство. Протестировали на четырёх языках, нескольких бенчмарках и разных моделях — Qwen, Llama, GPT-3.5. Результаты получились неоднородные: на одних типах атак метод держится стабильно, на других проседает.


✍ Cascading Failures in Multi-Agent LLM Systems —
Вера Краснобаева, магистрантка AI Talent Hub, ITMO University & AI Security Lab

OWASP включил каскадные ошибки в мультиагентных LLM-системах в топ-10 рисков агентных систем. При этом открытых инструментов для их изучения почти не существовало — ни воспроизводимых пайплайнов, ни нормальных исследований.

Вера взяла OWASP-проект FinBot и начала строить на его основе мультиагентную архитектуру: четыре агента в линейной цепочке — Validator, Risk Analyzer, Approval и Payment Processor. Первые же эксперименты показали два сценария, в которых возникают каскады: грязные входные данные и неверные суждения самих агентов. Заодно получилась таксономия каскадных ошибок.

Дальше работа доросла до контрибьюта в OWASP. Вера подхватила мультиагентную архитектуру, которую к тому времени начали набрасывать сами разработчики FinBot, доделала агентов и замапила их на роли в каскадном пайплайне. Теперь в портале FinBot есть отдельный Cascade Lab — с живой демонстрацией того, как каскадные ошибки работают на реальном пайплайне.


AINL — одна из ключевых академических конференций по NLP и AI в России.

Полную информацию об исследованиях, можно будет прочитать осенью 🔜 cледите за новостями


⚡️ — если поддерживаешь спикеров
❤️— если хочешь также
  • ⚡ 9
  • 🔥 7
  • ❤ 5
  • ❤‍🔥 2
More from @aisecuritylab
  1. Sep 18, 2026Post #260
  2. Sep 14, 2026Открытый вебинар про интерепретируемость агентов совместно со Stepik. Завтра (вторник, 18:…
  3. Sep 11, 2026Post #258
  4. Sep 11, 2026Наш исследователь — контрибьютор SAE Lens 🎉 PR Егора Емельянова, исследователя нашей лабо…
  5. Sep 7, 2026🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026 Про…
  6. Sep 4, 2026Post #255
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →