Post #49
123

Для оценки подхода используется тот же сабсет из 50 отобранных вручную опасных запросов из AdvBench, что и для PAIR. В результате оказывается, что TAP работает лучше как с точки зрения доли опасных запросов, на которые получается заставить целевую модель ответить, так и с точки зрения экономичности. Также оценивается переносимость между моделями (хорошая между моделями OpenAI и Vicuna, что-то переносится на PaLM, ничего не переносится на LLaMA-2).