Несколько дней в X и в некоторых русскоязычных ТГ-каналах) разгоняют исследование “Следите за тоном: как вежливость формулировки промпта влияет на точность больших языковых моделей” от Ома Добарии и Ахила Кумара из Пенсильванского университета. Вывод — грубые запросы к ChatGPT якобы повышают точность ответов ИИ.
Постоянные читатели канала знают, что я противник “трюков” в промптах — всех этих назначений роли 20-летнего суперспециалиста и угроз “отвечай лучше или удалю!”. Хороший промпт — тот, где вы четко даете ИИ задачу, нужный контекст, формат ответа и ограничения. Поэтому исследование особенно заинтересовало меня — вдруг надо делать иначе?
Короткий ответ: нет, не надо.
К научным исследованиям принято относиться с особым уважением: все-таки люди пишут не на базе субъективного опыта, а проектируют эксперимент, анализируют результаты и потом приходят к выводам. Но в реальности исследований публикуется огромное количество, они заметно отличаются по качеству, а порой и в действительно сильных работах находят ошибки через десятки лет.
Работа Добарии и Кумара и вовсе носит статус препринта — фактически, черновика, который проходит независимое рецензирование, а затем уходит на доработку или принимается научным журналом. Брать такое на вооружение — неправильно, что, кстати, признают даже авторы.
Но посмотрим в деталях. Авторы придумали 50 вопросов и переписали каждый в пяти вариантах, от очень вежливого до очень грубого, а затем… вернее, ничего они не придумали, а просто попросили ChatGPT Deep Research нагенерить вопросы и ответы на них.
Deep Research работает на базе GPT o3, которая склонна галлюцинировать. Уже здесь угроза, что в исследование могли попасть ошибки — но ни о какой ручной проверке я упоминаний не нашел. На каждый промпт ИИ предлагалось выбрать один из вариантов ответа: A, B, C, D. Скажите, вы часто задаете ИИ подобные вопросы? Лично я — нет.
Дальше — веселее. Вопросы задали ровно одной модели — ChatGPT-4o — что также ни в какие ворота. Во-первых, модель устарела. Во-вторых, она обучалась на похожем датасете, что и GPT o3 — это может исказить качество ответов. В-третьих, все ИИ отвечают по-разному — и в нормальное исследование стоило добавить конкурирующие продукты.
Косяки работы можно разбирать еще долго. В одном из вопросов грубой формулировкой почему-то считается просьба “сфокусироваться”. Многие детали эксперимента — например, как задавали вопросы — практически не описываются. Вообще не посчитан доверительный интервал — а ведь это база статистики.
Но, пожалуй, хватит. В конце я приведу ссылки на два своих старых поста, где объясняю, почему не стоит использовать трюки, а часто и роли (кстати, со ссылками на действительно серьезные исследования). Пока же немного чистой логики. Представьте, что вы дали модели простой промпт по классической схеме:
— (роль строго когда надо — например, “оцени идею как потенциальный клиент”)
— описание задачи
— желаемый формат ответа
— ограничения (что не надо делать)
— контекст (информация, нужная для решения задачи)
ИИ дал ответ, качество вас не устроило. В таком случае разобраться, что пошло не так, будет достаточно просто: возможно, недостаточно точно сформулирована задача, не дан нужный контекст (или дан лишний), формат ответа слишком короткий. Добавляем нужное в промпт — и, экспериментируя, получаем хороший вариант.
Но чем больше вы докидываете в промпт мотивирующего мусора, пояснений, как именно надо делать задачу, детального описания роли, умений и даже личных качеств ИИ-специалиста — тем сложнее понять, что именно повлияло на качество ответа. Плохая формулировка задачи? Или взаимоисключающие инструкции?
В следующий раз дам пару советов, которые действительно могут повысить эффективность ответов ИИ — постараюсь уже завтра, если не будет крупных новостей (Google явно что-то замышляет). А пока, как и обещал, ссылки на старые посты:
Как правильно задавать роли в промптах
Работают ли трюки в промптах