Итак, модели учатся врать, причем так, чтобы нам было приятно, а причиной этого являются, сюрприз, данные, на которых они учатся, поскольку в этих данных ответы с заискиванием перед пользователем имеют более высокие оценки, чем ответы без. Стоит не забывать, что если в обучающих данных нет рецептов воссоздания вызывающих пандемии штаммов гриппа, то модель такой рецепт сама не выдумает, как ее не джейлбрейкай, и, напротив, если в процесс обучения добавить данные, демонстрирующие игнорирование prompt-инъекций, то модель будет более к ним устойчива. Фундаментально это значит, что даже лучшие команды по созданию инструктивных LLM, как у Anthropic, могут оверфититься на признак не только не имеющий отношения к цели обучения, но и даже ему противоречащий, а значит пока о надежности приложений на базе LLM говорить не приходится.
Лингвистическая заметка: по-русски сикофант – это не льстец и подхалим, а доносчик или клеветник, так что это faux amis.
Post #203
207