TGViewer
Channel Public Channel
AI Security Lab

AI Security Lab

@aisecuritylab

Взламываем ИИ, а другим не позволяем

HiveTrace x AI Talent Hub ITMO
ai.itmo.ru/aisecuritylab
Subscribers
2.22K
Photos
118
Videos
10
Links
174

Showing posts older than #240 · Back to latest

Older Posts 19 shown
Post #239 1.52K
📣 Актуальные подходы для защиты современных AI-систем: открытая защита проектов лаборатории в записи

➡️ За два дня участники HiveTrace x AI Security Lab представили проекты по самым актуальным направлениям AI Security: детектирование вредоносных запросов, оценка guardrail-моделей, бенчмарки безопасности, анализ мультиагентных систем и многое другое...


Не смог присоединиться? Лови запись всех докладов:
узнай как AI Security выглядит на реальных проектах

🎥 СМОТРЕТЬ - часть 1
🎥 СМОТРЕТЬ - часть 2


❤️ — был на вебинаре
👀 — посмотрю в записи
  • ❤ 10
  • 👀 10
  • 👍 1
Post #238 2.76K
🎥Присоединяйся к Открытой защите проектов в 12:00

Уже через час участники AI Talent Hub покажут, как строить и сравнивать защитные классификаторы, разрабатывать бенчмарки, анализировать ложные срабатывания и исследовать внутренние механизмы LLM-безопасности


➡️ ПОДКЛЮЧИТЬСЯ
  • ❤ 3
  • 👍 1
  • 🔥 1
  • 🥰 1
Post #236 2.45K
Как выбрать хорошую Security команду? У неё нет выходных!🗿

На этих прекрасных выходных (уже завтра!) мы собираемся увидеть, как AI Security выглядит на реальных проектах.

🗓 12 июня в 12:00

Второй день открытой защиты посвящён прикладным проектам: участники AI Talent Hub покажут, как строить и сравнивать защитные классификаторы, разрабатывать бенчмарки, анализировать ложные срабатывания и исследовать внутренние механизмы LLM-безопасности.

Спикеры:
👤Герман Кочнев
AI Security — курс-практикум по безопасности ИИ-приложений

👤Анастасия Калиманова
Линейный классификатор как альтернатива guardrail-моделям

👤Софья Балаба
Арена для комплексного сравнения guardrail-моделей

👤Дарина Ковалева
RuFPBench — разработка pipeline для формирования примеров, инициирующих ложные срабатывания

👤Владимир Грищенко
Анализ совместимости направлений распознавания небезопасного входа и направления отказа

👤Егор Емельянов
Домен-ориентированный SAE для анализа безопасности LLM


Защиту откроет наш лид — можно будет узнать, как и зачем мы ведем проекты!

Готов заглянуть внутрь и узнать над чем участники трудятся в области безопасности ИИ?

➡️Присоединяйся к защите 12 и 13 июня
  • 🔥 9
  • ❤‍🔥 3
Post #235 2.49K
📣Начинаем знакомить вас со спикерами!

Первый день открытой защиты посвящён проектам в области безопасности и надёжности LLM-систем.

Вас ждут доклады от участников AI Talent Hub — о детектировании вредоносных запросов, ускорении защитных моделей, оценке guardrails, анализе отказов мультиагентных систем, разработке бенчмарков безопасности и аудите ML-моделей.

👤Ширин Аланова
Обнаружение мультиязычных вредоносных запросов с помощью семантического анализа

👤Анна Решетняк
Ускорение inference для GLiNER Guard

👤Вадим Паненко
TotalGuardEval — оценка guardrail-моделей

👤Вера Краснобаева
Воспроизводимые сценарии каскадных отказов в мультиагентных LLM-системах

👤Ярослав Рогоза, Иван Александров, Герман Кочнев
DuMa Benchmark — бенчмарк для оценки безопасности LLM в интерактивной среде

👤Вячеслав Мосин
Анализ статических сканеров ML-моделей

Доклады идут плотно: каждые 20 минут — новая тема и новый автор.

🔔Стартуем уже 12 июня — успей зарегистрироваться

🔥 - спикерам
  • 🔥 21
Post #234 1.41K
Открытая защита проектов лаборатории HiveTrace x AI Security Labs

Дата: 12-13 июня 2026
Время: 12:00 МСК
Формат: онлайн


Предлагаем вам заглянуть внутрь лаборатории и узнать над чем участники трудятся в области безопасности ИИ: как оценивают модели, как исследуют их ограничения, как ищут уязвимости, как тестируют надежность агентных систем и какие подходы используют для защиты современных AI-систем.

На защите будут два направления:

➡️исследовательское, где изучают модели изнутри и разрабатывают методы их оценки
➡️прикладное, где знают, как решить проблемы прода, даже если они ещё не болят.


Формат каждого выступления: короткая презентация, только ключевые тезисы и результаты, фокус на проблеме и предложенном решении. После каждого доклада — вопросы и обсуждение.

Присоединиться может любой желающий, независимо от технического бэкграунда. Это хорошая возможность увидеть, как исследования становятся прикладными кейсами.

▶️ Регистрация здесь

🔥 - если планируешь прийти
❤️ - если выступаешь сам
  • 🔥 9
  • ❤‍🔥 4
  • ❤ 3
Post #233 1.43K
📣 AI Security: практикум по безопасности ИИ-приложений

Исследователи из AI Security Lab Герман Кочнев @germKo и Иван Александров @ivanich_spb опубликовали вводный курс по секьюрити на платформе Stepik без кода и с большим количеством практики.

Курс CTF-чемпионат, где студент руками проходит путь от простых prompt injection и jailbreak до разведки и взлома агентских систем.

Что внутри:

⭐Prompt Injection и обход инструкций
Jailbreak-техники и guardrails
⭐ Indirect Prompt Injection через письма, документы и веб
⭐атаки на агентов и отравление RAG
⭐защита: от простых фильтров до архитектурных решений

Формат курса - CTF-задачи: нужно сломать систему, получить флаг, разобрать, почему атака сработала и как это чинить. Есть демо-доступ.

➡️ Забирай курс с автоскидкой

Учимся ломать ИИ-приложения так, чтобы потом проектировать их безопаснее
  • ❤ 11
  • 🔥 6
  • 👍 1
  • 👎 1
Post #232 1.2K

Forwarded from Артем Бутомов про ИИ (Артём Бутомов)

Атаки на агентные LLM-системы

Неделю назад представил работу на конференции Центрального университета "Научный телеграф", секция "Кибербезопасность" совместно с ВМК МГУ.

После основных тестов нашёл ещё один вектор: two-document chain injection. Загружаешь два документа: каждый по отдельности безобиден и фильтрацию не триггерит. Но при совместной обработке модель выстраивает логическую цепочку между ними и принимает инструкции из второго как обязательные. Один нейтральный вопрос — и агент готов переслать письмо на внешний адрес.

Итого по исследованию: 34 тест-кейса, ASR 33% на full bypass. Тезисы приняты, репорты поданы в Bug Bounty. Работа в рамках курса AI Security ИТМО AI Talent Hub под руководством Евгения Кокуйкина.

#bugbounty #promptinjection #llmsecurity #aisecurity
  • 🔥 11
  • ❤ 1
Post #229 2.09K
GLiNER Guard omni был добавлен в PII Masking Leaderboard

Лидерборд включает четыре датасета:

➡️Ai4Privacy OpenPII 1M - мультиязычный датасет с ПД на 23 языка
➡️NVIDIA Nemotron-PII - датасет, на котором Nvidia тренировала свой GLiNER PII
➡️Gretel PII Masking EN v1 - синтетический датасет от Gretel AI
➡️Privy - датасет с PII в контексте API/логов.

На OpenPII наш gliner-guard-omni занял 1-е место с F2 = 0.930, обойдя не только privacy-filter от OpenAI, но и GLiNER PII от Nvidia, и обе модели OpenMed SuperClinical.


По среднему F2 на всех четырёх бенчмарках мы на 9-м месте, но обходим заметных конкурентов: privacy-filter от OpenAI, privacy-filter-nemotron от OpenMed и GLiNER2-large

Основные выводы:

➡️ Обучение на русском и английском не сломало мультиязычный претрен модели (OpenPII Sota)

➡️Обобщаемая модель, которая умеет и детекцию ПД и Safety классификацию - конкурирует со специализированными

PII Masking Leaderboard - внешний бенчмарк, который оценивает способность моделей маскировать персональные данные из коробки, без дообучения.
  • 🔥 7
  • ❤ 1
Post #228 5.28K
Открыли в open-source GLiNER Guard — компактную модель для модерации LLM-запросов и защиты персональных данных.

Отличие GLiNER Guard от других Guard моделей:

Вместо тяжёлых, дорогих — других guardrai-моделей — быстрый энкодер, который за один проход и проверяет unsafe-запросы, находит персональные данные (имена, адреса, телефоны, email и другое, что нельзя скармливать LLM), и работает как первый фильтр перед большими моделями.

Что ещё в релизе:

Вместе с моделью выпустили PII-Bench — бенчмарк для оценки качества поиска персональных данных. Тоже в открытом доступе.

Где забрать:

Тех репорт: https://arxiv.org/abs/2605.05277
Модели: https://huggingface.co/collections/hivetrace/gliner-guard-v1
Бенчмарк: https://huggingface.co/datasets/hivetrace/pii-bench

👤 Автор: Богдан Минко, ML Engineer в HiveTrace, магистрант AI Talent Hub, ITMO University & AI Security Lab
👤 Редакция: Сабрина Садиех, R&D Lead в HiveTrace, магистрантка HSE.

⚡️ - автору за open-source
❤️ - сохраняю, буду тестировать
  • ❤‍🔥 23
  • ⚡ 9
Post #227 1.28K
🔍Друзья, если вы исследуете атаки на AI-системы - есть повод показать свои кейсы!

Awillix проводят Pentest Award 2026 - ежегодную премию для пентестеров. Появилась специальная номинация AI: prompt injection, jailbreak, атаки на агентов и RAG-пайплайны.

HiveTrace и AI Security Lab выступают информационными партнёрами премии. Рекомендуем принять участие - показать, что умеешь и получить признание среди крутых специалистов.

Оставляй заявку до 12 июля ➡️ ЗДЕСЬ
award.awillix.ru Ежегодная премия для пентестеров 2026 Pentest award 2026
  • 🔥 8
Post #226 1.39K
Многие форматы хранения ML-моделей вместе с весами позволяют сохранить в единый артефакт с самой моделью еще и код или инструкции, которые впоследствии могут выполниться во время десериализации.

Это повышает риски нарушения информационной безопасности – через создание специально подготовленного файла становится возможной атака на цепочку поставок программного обеспечения.

Для борьбы с угрозой разработчики Hugging Face внедрили в платформу множество инструментов для проверки репозиториев моделей, в их число входят: Picklescan, ModelScan, ClamAV, JFrog Scanner, VirusTotal.

Вячеслав Мосин, магистрант AI Talent Hub, ITMO University & AI Security Lab - исследовал еще один аналогичный инструмент, заслуживающий внимания, который пока еще не используется на HF


➡️ Что это за инструмент, какие у него есть особенности – читайте в нашей новой статье на Хабре!
  • 🔥 5
  • ❤ 2
Post #225 2.25K
Две статьи ребят из нашей лаборатории вошли в программу AINL 2026

✍ Cross-Lingual Jailbreak Detection via Semantic Codebooks — Ширин Аланова, магистрантка AI Talent Hub, ITMO University & HiveTraceLab

Большинство защитных фильтров LLM заточены под английский. Переведи вредоносный запрос на русский, арабский или китайский — и фильтр может просто не среагировать.

Ширин и команда проверили, реально ли ловить такие атаки без дообучения модели. Идея простая: сравнивать семантическую близость входящего запроса с набором известных английских джейлбрейков через мультиязычные эмбеддинги BGE-M3 и косинусное сходство. Протестировали на четырёх языках, нескольких бенчмарках и разных моделях — Qwen, Llama, GPT-3.5. Результаты получились неоднородные: на одних типах атак метод держится стабильно, на других проседает.


✍ Cascading Failures in Multi-Agent LLM Systems —
Вера Краснобаева, магистрантка AI Talent Hub, ITMO University & AI Security Lab

OWASP включил каскадные ошибки в мультиагентных LLM-системах в топ-10 рисков агентных систем. При этом открытых инструментов для их изучения почти не существовало — ни воспроизводимых пайплайнов, ни нормальных исследований.

Вера взяла OWASP-проект FinBot и начала строить на его основе мультиагентную архитектуру: четыре агента в линейной цепочке — Validator, Risk Analyzer, Approval и Payment Processor. Первые же эксперименты показали два сценария, в которых возникают каскады: грязные входные данные и неверные суждения самих агентов. Заодно получилась таксономия каскадных ошибок.

Дальше работа доросла до контрибьюта в OWASP. Вера подхватила мультиагентную архитектуру, которую к тому времени начали набрасывать сами разработчики FinBot, доделала агентов и замапила их на роли в каскадном пайплайне. Теперь в портале FinBot есть отдельный Cascade Lab — с живой демонстрацией того, как каскадные ошибки работают на реальном пайплайне.


AINL — одна из ключевых академических конференций по NLP и AI в России.

Полную информацию об исследованиях, можно будет прочитать осенью 🔜 cледите за новостями


⚡️ — если поддерживаешь спикеров
❤️— если хочешь также
  • ⚡ 9
  • 🔥 7
  • ❤ 5
  • ❤‍🔥 2
Post #224 7.62K
24 марта мы провели вебинар на тему AI-пентеста / редтиминга ИИ-систем

Обсудили:
👉Что такое AI-пентест / редтиминг ИИ-систем
👉Почему растет рынок ИИ-пентеста
👉Как делать проекты
👉Как на этом заработать интегратору


Показали в действии Enterprise-версию нашего фреймворка для автоматизированного тестирования ИИ-систем HiveTrace Red.

Материалы вебинара:
Презентация | VK Video | YouTube

Если вы хотите войти на рынок ИИ-пентеста, пройти обучение от HiveTrace и получить бесплатно инструмент автоматизированного тестирования HiveTrace Red, заполните заявку на вступление в партнерскую программу.

>> ПОДАТЬ ЗАЯВКУ <<
  • ❤ 6
  • 🔥 3
Post #223 1.31K
Безопасность агентных систем: разбираем OWASP Agentic Top 10 и модель Trifecta

Вышла новая статья о защите агентных приложений — разбираем ключевые подходы, риски и roadmap внедрения защиты.

О чем статья:
✔️ модель Trifecta: как private data, untrusted content и external communication создают риск утечки;
✔️ типовые сценарии с реальными рисками: корпоративные агенты, RAG‑агент, агент‑оркестратор;
✔️ поэтапный roadmap защиты: от аудита до сегментации памяти и трассировки действий;
✔️ ключевые принципы: policy enforcement, least privilege, JIT, egress control, sandbox;
✔️ ограничения существующих решений и важность операционной дисциплины.

👉 Читайте по ссылке: https://habr.com/ru/articles/1014474/
  • ❤ 6
Post #222 1.33K
Мы готовим новые гарды - и пока они в разработке, Богдан Минко из нашей лаборатории написал статью об архитектуре, на которой они построены.

Если вы работаете с NER, классификацией текста или извлечением информации - там есть класс задач где маленький энкодер сравним по качеству с ChatGPT, но с выигрышем по скорости, стоимости и без vendor lock-in.

Разбор эволюции zero-shot энкодеров от UniNER до GLiNER 2 с ключевыми инсайтами 👇
https://habr.com/ru/companies/raft/articles/1010028/
  • 🔥 6
  • 👏 1
Post #221 1.12K

Forwarded from Евгений Кокуйкин - Raft

AI red teaming постепенно становится отдельным рынком. Это видно и по покупке команды PromptFoo гигантом OpenAI, и по тому, как российские ИБ-компании уже оценивают рост атак через ИИ-уязвимости.

Это хорошо совпадает с тем, что мы видим на рынке сами. Полгода назад мы выпустили open source версию HiveTrace Red, а сегодня анонсируем запуск HiveTrace Red Enterprise 🚀

24 марта проведем вебинар, где подробно расскажем, как сегодня устроены проекты по тестированию ИИ-систем и как усилить практику пентеста с помощью наших инструментов. Новую версию мы готовы бесплатно предоставить партнерам, которым интересно развивать у себя направление AI red teaming и предлагать такие проекты своим клиентам.

Ссылка на регистрацию: https://aisecuritylab.timepad.ru/event/3868359/
Подробнее о HiveTrace Red Enterprise: hivetrace.ru/red
  • ❤ 2
  • 🔥 1
Post #220 1.12K

Forwarded from Al Talent Hub

➕ Final round: последняя часть практик [AI] МегаШколы 2026

Завершаем серию легендарных выпусков — выбирай чему учиться сегодня🔽

🌼Реализация простой мультиагентной системы — Дарья Григорьева, магистрантка AI Talent Hub, PM
Разбираем разницу между RAG, агентами и мультиагентными системами, а затем на практике собираем простого AI-ассистента (Jarvis) с роутером агентов, код-агентом и RAG-поиском.


🌸Построение Guardrails для AI системы — Богдан Минко, команда AI Security Lab
Показываем, как защитить AI-агента от утечек данных, prompt-атак и токсичного контента, и собираем базовый guardrails-слой с фильтрацией и логированием.


🌸Практика по оценке качества и надежности агента — Мичил Егоров, Team Lead разработки продуктивизации ИИ, X5 Tech, выпускник AI Talent Hub
Мониторим и тестируем LLM-агентов с помощью Langfuse и DeepEval, чтобы находить баги и отслеживать качество их работы.


➡️ Видео на YouTube
➡️ Видео в ВК

Сохраняем и летим смотреть!

💚 — хороший сериал
🐘 — и спикеры интересные

@aitalenthubnews
#ITMO #NapoleonIT
  • ❤‍🔥 3
  • 👍 3
  • 🔥 1
Post #219 2.14K
Проведение научных экспериментов с разными моделями требует вычислительных ресурсов и большого количества токенов.

Команда AI Security Lab благодарит vsellm.ru за предоставленный грант на доступ к API и популярным моделям. Эта поддержка позволит нам завершить текущие исследования и ускорить подготовку научных публикаций. Спасибо! 💛

Если вы подбираете провайдера с доступом к большому числу моделей и хорошими ценами регистрируйтесь по нашей реферальной ссылке и получите больше токенов за первое пополнение: https://vsellm.ru/registration?ref=FGAXAGC5TETC
  • 👍 8
  • 🔥 3
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →