Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи R&D-команда Just AI. Мы копаем NLP и GenAI, чтобы продукты конторы не выпадали из статуса SOTA на рынке. В частности на нас висят guard-модели и бенчмарки для Jay Guard — про них и пойдёт речь.
За последние два года исследователи и хакеры придумали кучу способов вытащить данные через AI-ассистентов: где-то утащили данные тенантов Microsoft 365, где-то — содержимое приватных каналов Slack. И никакого эксплойта в привычном понимании не потребовалось. В ход пошло то, чем соц-инженеры полвека доят людей: втереться в доверие, прикинуться начальством, попросить об услуге по мелочи. Просто жертвой теперь оказалась не человек, а модель.
В Just AI пилят guardrails для LLM-приложений и агентов, основной продукт — Jay Guard. Это AI-Security-прослойка между приложением и моделью: через неё прогоняются проверки на атаки, контент и персональные данные. В статье разберём текстовые детекторы Jay Guard и данные, на которых они обучаются, почему готовые модели на русскоязычном трафике дали слишком много ложных блокировок, что изменилось после переработки данных и какие ограничения остались.
Обучить модель — это только начало. Дальше начинается основное: постоянно держать качество, когда атаки меняются, а трафик — реальный, живой. Читать далее
👉 Telegram | Max
Post #5956
851
