Forwarded from Raft
This post (sticker, poll or similar) has no web preview. Open in Telegram
- ❤ 5
- 🤩 1
AI @aisecuritylab
Forwarded from Raft
This post (sticker, poll or similar) has no web preview. Open in Telegram
This post (sticker, poll or similar) has no web preview. Open in Telegram
This post (sticker, poll or similar) has no web preview. Open in Telegram
This post (sticker, poll or similar) has no web preview. Open in Telegram
Forwarded from HiveTrace
This post (sticker, poll or similar) has no web preview. Open in Telegram
This post (sticker, poll or similar) has no web preview. Open in Telegram
This post (sticker, poll or similar) has no web preview. Open in Telegram
This post (sticker, poll or similar) has no web preview. Open in Telegram
This post (sticker, poll or similar) has no web preview. Open in Telegram
Forwarded from HiveTrace

➡️ как HiveTrace Hooks работают с Claude Code;
➡️ как анализировать пользовательские запросы до передачи в Claude;
➡️ как проверять tool calls до фактического выполнения;
➡️ как контролировать параметры и допустимость действий;
➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент;
➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw;
fake
injection
deception
blackmail
self-preservation
evaluation
Модель представляет собой мультимодальный guard на базе Gemma-3-4B-it, который разработчики подают как SLM (small language model). Она объединяет два предыдущих релиза: мультимодальную модерацию из Nemotron 3 Content Safety и работу с кастомными политиками из Nemotron Content Safety Reasoning 4B.
Может быть полезен тем, кто работает с кодовыми ассистентами и планирует интегрировать Guard слой в Claude Code, Cursor и другие ИИ инструменты.
Датасет с описаниями политик, который состоит из следующих пунктов: список разрешённых тем, их названия и описания, и сверху много промпта, который будет кушать latency в real time.