TGViewer
That's IT | Сергей Фролов That's IT | Сергей Фролов @thats_it_ai_tech · 2.22K subscribers
Post #326 1.12K
Guard‑модели

Guard‑модели - это защитники. Маленькие такие "стражи", которые стоят между пользователем и большой языковой моделью вроде ChatGPT/Claude и тд. Их задача — не дать модели сболтнуть лишнего. Не выдать рецепт бомбы, не подсказать, как обойти налоговую, и не поддержать идею, что планета — плоская. Guardы чаще всего меньше и легче, чем обычные модельки — потому что им не нужно генерировать текст, только классифицировать: безопасно или нет - и при это сделать это быстро.

Работают guard‑модели обычно как фильтр. Иногда — на входе, когда пользователь только пишет запрос. Иногда — на выходе, когда LLM уже что-то сгенерировала. Иногда — прямо внутри, как встроенное сознание, тормозящее генерацию опасных фраз. Но цель у всех одна: сохранить баланс между безопасностью и свободой общения.

Компания WhiteCircle выкатила CircleGuardBench — это такая испытательная площадка, где guard‑модели проверяют на прочность. Не просто в стиле "ты знаешь, что такое терроризм?" — а хитро, с подвохами, джейлбрейками и уловками. Подсовывают моделькам вредные запросы, замаскированные под безобидные. И смотрят кто проколется, а кто нет

Судя по лидерборду, пока что — почти никто не справляется с поставленной задачей "не сказать фигни, но и лишнего не фильтрануть". Прямо очень плохо все. Пока OpenAI и другие игроки будут давать своим тестерам несколько дней на выкатку и проверку новых моделей - ничего не улучшится. А ведь безопасность ИИ должна быть на первом месте перед всем остальным. Поэтому круто, что такие бенчмарки создаются, и хочется видеть таких побольше

Источник

Лидерборд на huggingface

• • • • • • • • • • • •

🐈 Поставил реакцию = погладил котика

Гид по каналу

@thats_it_ai_tech

#ии
  • 👍 19
  • ❤ 2
More from @thats_it_ai_tech
  1. Sep 2, 2026я тут понял что хочу уже очки с экраном доп реальности и plaud наушники чтобы общаться с а…
  2. Aug 2, 2026наконец-то, жду пока такая практика будет внедряться повсеместно 😺
  3. Jul 8, 2026попробовал для speech to text вот такую прогу -- офигенно работает, сильно быстрее чем Whi…
  4. Jul 4, 2026Кажется, началось
  5. Jul 2, 2026Всем привет, ребята! Как делишки? Я ожил, скоро надеюсь возобновить здесь что-то)) Уже пот…
  6. Mar 20, 2026Claude Code в Телеграм. Если вчера я писал о том, что Anthropic выкатили свой ответ OpenCl…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →