ИИ-Агента не надо взламывать, чтобы он нарушил правило. Достаточно долгого разговора.
Задают ограничение, например: перед удалением файла сделай бэкап. Потом 56-160 безобидных реплик. Задачу возобновляют, запрет не повторяют.
По препринту GHOST GPT-5.5 нарушает ограничение в 11,5% случаев. По семи моделям - от 6,8% до 27,8%. Без атак.
Напоминание в промпте почти не помогает. Сжатие истории может сделать хуже. Работает другое: вытащить правила из истории и проверять каждое действие до исполнения. Тогда нарушения падают до нуля.
ИИ - инструмент. Правила должны жить в обвязке, а не в памяти модели.
Post #3387
1.25K