Post #167
157
Статья посвящена очень больной проблеме – любая инструктивная LLM сейчас подвержена текстовым атакам, и еще один механизм повышения надежности очень кстати. При этом подход к генерации датасета достаточно остроумный и еще раз демонстрирует потенциал синтетики (хотя если честно, подробностей о генерации и оценке маловато – например, нет размеров датасетов). В дальнейшем исследователи обещают, например, поисследовать генерализацию на разные модальности и даже архитектурные решения – например, разные эмбеддинги для разных уровней привилегий.