Guard‑модели
Guard‑модели - это защитники. Маленькие такие "стражи", которые стоят между пользователем и большой языковой моделью вроде ChatGPT/Claude и тд. Их задача — не дать модели сболтнуть лишнего. Не выдать рецепт бомбы, не подсказать, как обойти налоговую, и не поддержать идею, что планета — плоская. Guardы чаще всего меньше и легче, чем обычные модельки — потому что им не нужно генерировать текст, только классифицировать: безопасно или нет - и при это сделать это быстро.
Работают guard‑модели обычно как фильтр. Иногда — на входе, когда пользователь только пишет запрос. Иногда — на выходе, когда LLM уже что-то сгенерировала. Иногда — прямо внутри, как встроенное сознание, тормозящее генерацию опасных фраз. Но цель у всех одна: сохранить баланс между безопасностью и свободой общения.
Компания WhiteCircle выкатила CircleGuardBench — это такая испытательная площадка, где guard‑модели проверяют на прочность. Не просто в стиле "ты знаешь, что такое терроризм?" — а хитро, с подвохами, джейлбрейками и уловками. Подсовывают моделькам вредные запросы, замаскированные под безобидные. И смотрят кто проколется, а кто нет
Судя по лидерборду, пока что — почти никто не справляется с поставленной задачей "не сказать фигни, но и лишнего не фильтрануть". Прямо очень плохо все. Пока OpenAI и другие игроки будут давать своим тестерам несколько дней на выкатку и проверку новых моделей - ничего не улучшится. А ведь безопасность ИИ должна быть на первом месте перед всем остальным. Поэтому круто, что такие бенчмарки создаются, и хочется видеть таких побольше
Источник
Лидерборд на huggingface
• • • • • • • • • • • •
🐈 Поставил реакцию = погладил котика
❓ Гид по каналу
✨ @thats_it_ai_tech
#ии
Post #326
1.12K

- 👍 19
- ❤ 2