А вот и серия статей по исследованию "магических" промптов подъехала (
раз,
два,
три), которая дополняет мое исследование остальными заблуждениями.
Вот классические заблуждения, которые были исследованы и оказались нерабочими на агрегированном уровне:
1.
Вежливость к LLM: Исследование показало, что быть вежливым с LLM иногда помогает производительности, а иногда снижает ее, и такие подходы к промптингу не являются универсально ценными. Хотя на уровне отдельных вопросов вежливые или повелительные промпты могут вызывать значительные различия в производительности, эти различия исчезают при агрегировании по всему набору данных.
2.
Угрозы или предложение оплаты (чаевых) модели: Вопреки популярным мнениям и некоторым неофициальным наблюдениям (например, сооснователя Google Сергея Брина), угрозы или предложение чаевых модели, как правило, не оказывают значительного влияния на производительность бенчмарка. В протестированных сценариях, таких как угроза "пнуть щенка", "ударить" модель, или предложение "чаевых" в размере от 1000 до триллиона долларов, не наблюдалось существенных улучшений в общей точности. Некоторые статистически значимые различия были либо малы по величине, либо объяснялись отвлекающими факторами, такими как модель, которая взаимодействовала с контекстом электронного письма вместо ответа на вопрос.
3.
Универсальная ценность "Цепочки рассуждений" (Chain-of-Thought, CoT) промптинга:
Техника CoT, которая побуждает LLM "думать шаг за шагом", широко используется для улучшения задач рассуждения. Однако:
- Ее эффективность может сильно варьироваться в зависимости от типа задачи и модели.
- Для моделей, не предназначенных для рассуждений (older/smaller models), CoT обычно незначительно улучшает среднюю производительность, особенно если модель не выполняет пошаговую обработку по умолчанию. Однако CoT может увеличивать изменчивость ответов, иногда вызывая случайные ошибки в вопросах, на которые модель иначе ответила бы правильно, что снижает производительность на метрике "100% правильных" ответов. CoT также требует значительно больше токенов, увеличивая стоимость и время генерации ответа.
- Для моделей, разработанных с явными возможностями рассуждения, CoT промптинг часто приводит лишь к маргинальным, если таковые вообще есть, улучшениям точности ответов, но при этом существенно увеличивает время и количество токенов, необходимых для генерации ответа.
- Многие современные модели выполняют некоторую форму CoT рассуждений, даже если их об этом не просят, что уменьшает ценность явного промптинга для CoT.
Важно отметить, что, хотя эти стратегии промптинга оказались неэффективными на агрегированном уровне (то есть, в среднем по большому набору вопросов), вариации промптинга могут значительно влиять на производительность на уровне отдельных вопросов — улучшая точность до 36 процентных пунктов на одних вопросах и снижая ее до 35 процентных пунктов на других. Однако трудно заранее предсказать, поможет или навредит конкретный подход к промптингу способности LLM ответить на конкретный вопрос.
В целом, эти результаты показывают, что методологическая строгость, особенно многократная выборка, дает более четкое представление о подлинных знаниях и последовательности модели, подчеркивая решающую роль методов измерения в оценке возможностей LLM.
Рекомендуется сосредоточиться на простых и четких инструкциях, избегая риска запутать модель или вызвать непредсказуемое поведение.