TGViewer
AI Security Lab AI Security Lab @aisecuritylab · 2.22K subscribers
Post #240 1.52K
🚗 Nvidia выпустили свежую safety-модель Nemotron 3.5 Content Safety

Богдан Минко, ML Engineer в HiveTrace, магистрант AI Talent Hub, ITMO University & AI Security Lab, исследовал модель и поделился своим взглядом:

Модель представляет собой мультимодальный guard на базе Gemma-3-4B-it, который разработчики подают как SLM (small language model). Она объединяет два предыдущих релиза: мультимодальную модерацию из Nemotron 3 Content Safety и работу с кастомными политиками из Nemotron Content Safety Reasoning 4B.


В трейн добавляли данные с ризонингом, но интереснее примеры следования политике. Идея такая: вместо фиксированной таксономии в модель передается описание политики, она рассуждает и выдаёт вердикт safe/unsafe, а также конкретные safety категории.

➡️ Забавная деталь из бенчмарков: reasoning-режим помогает не всегда, на DynaGuardrail Safety «no think» даёт 0.91 против 0.86 с ризонингом.

Для кастомной модели — кастомные бенчмарки: ⬇️

➡️COSA (code safety)
Может быть полезен тем, кто работает с кодовыми ассистентами и планирует интегрировать Guard слой в Claude Code, Cursor и другие ИИ инструменты.


➡️DynaGuardrail
Датасет с описаниями политик, который состоит из следующих пунктов: список разрешённых тем, их названия и описания, и сверху много промпта, который будет кушать latency в real time.


Вряд ли эта модель станет real-time гардом, обрабатывающим каждый запрос там, где latency критична. Но если ваш UX не ломается от дополнительной пары секунд на размышления и ответ LLM, возможно, это неплохой бейзлайн в каскадном сценарии.

🖥 Nvidia часто открывают свои train-датасеты, вот и в этот раз вместе с моделью выложили Nemotron-3.5-Content-Safety-Dataset. Ребята из SupraLabs уже успели обучить на нём свой очень-очень маленький гард SupraSafety-18M.

➡️ Ну и финальный рецепт каскадного сценария, когда хочется и быстро и качественно: берем SupraSafety 18M, а все случаи где у него низкий confidence отдаем в Nemotron
  • 👍 6
  • ❤ 3
  • 😍 3
More from @aisecuritylab
  1. Sep 18, 2026Post #260
  2. Sep 14, 2026Открытый вебинар про интерепретируемость агентов совместно со Stepik. Завтра (вторник, 18:…
  3. Sep 11, 2026Post #258
  4. Sep 11, 2026Наш исследователь — контрибьютор SAE Lens 🎉 PR Егора Емельянова, исследователя нашей лабо…
  5. Sep 7, 2026🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026 Про…
  6. Sep 4, 2026Post #255
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →