TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #637 280
🚨 OpenAI выпустила GPT-OSS Safeguard: открытую систему безопасности для ИИ

Компания OpenAI представила GPT-OSS Safeguard: набор открытых моделей, которые помогают проверять безопасность контента и отслеживать корректность работы других нейросетей.

Это шаг к тому, чтобы сделать процессы Trust & Safety прозрачнее и управляемее.

🧩 OpenAI выпустила две модели: gpt-oss-safeguard-120B и gpt-oss-safeguard-20B.
Обе доступны с открытыми весами по лицензии Apache 2.0 их можно использовать, модифицировать и запускать локально.
📜  Модель принимает правила безопасности (policy) во время выполнения.
Разработчик может задать собственные критерии, и Safeguard классифицирует запросы или ответы по этим правилам.

💬 Ещё одно преимущество в том, что модель возвращает обоснование решения (chain-of-thought), что делает проверку прозрачной и в теории пригодной для аудита.

Подробнее в официальном блоге OpenAI.

🧠 Что умеет модель?

🤖 Модель анализирует текст, сопоставляет его с правилами и выдает оценку риска.
Например, она может определить, что сообщение содержит обход фильтра, и пометить его как «high risk».

📊 Вместо обычного «разрешено/запрещено» Safeguard объясняет, почему принято то или иное решение.
Это можно использовать для логирования, расследований и улучшения политики безопасности.

🔐 Новые возможности

Safeguard позволяет:
⚙️ внедрять собственные правила и политики проверки;
🔒 запускать модель внутри корпоративного периметра;
📑 анализировать reasoning-цепочки при расследованиях;
🧠 адаптировать правила без повторного обучения модели.

Открытые веса делают систему гибкой и позволяют интегрировать её в решения, где важно хранить данные локально.

⚠️ Риски

🔓 Открытые модели это не только гибкость, но и сложность настройки.
Если политика безопасности описана неточно, возможны ошибки классификации и ложные срабатывания.
🧨 Reasoning-модели можно обмануть подобранными запросами (prompt injection), поэтому нужно внедрять дополнительные инструменты защиты.

💬 Вопросы, на которые предстоит ответить

❓ Насколько reasoning реально помогает в аудите?
🧩 Можно ли избежать утечек через объяснения модели?
⚡ Подходит ли Safeguard для real-time систем?

Stay secure and read SecureTechTalks 📚

#OpenAI #ИИ #Кибербезопасность #TrustAndSafety #AIsecurity #MachineLearning #DataProtection #CyberThreats #TechNews #SecureTechTalks
  • 🔥 2
More from @securetechtalks
  1. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  2. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  3. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  4. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  5. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  6. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →