Далее авторы предлагают некоторое количество вариантов защиты от их атаки: замену logit bias на черные списки, добавление шума, запрет одновременного использования logit bias и получения лог-вероятностей, добавление шума, рейт-лимитинг и так далее. Каждый из этих методов или делает атаку более сложной, или целиком ее предотвращает.
На мой взгляд, это одна из лучших статей на тему атак на большие языковые модели из разобранных на этом канале, да еще и демонстрирующая, зачем в последневной жизни нужна линейная алгебра 🤓
Post #253
208
- 👍 1
- 🥴 1