👉Кому интересно почитать про то, как сделать LLM более сговорчивой на разные темы (abliteration = ablated + obliterated), предлагаю посмотреть в материале тут
Грубо говоря, имея некоторый harmful датасет, его прогоняют через модель, определяют активации, которые сигнализируют об отказах модели отвечать на какие-то вопросы, а потом ортогонализируют соответствующие тензоры. Так модель сохраняет основную часть своих весов нетронутыми, а refusal direction за счёт ортогонализации меняется. Конечно, речь не идёт об устранении 100% отказов отвечать на вопросы, но тем не менее позволяет «ослабить» LLM
Post #452
3.64K