TGViewer
сбежавшая нейросеть сбежавшая нейросеть @ai_exee · 23.9K subscribers
Post #259 5.23K
И все-таки не стоит грубить ChatGPT

Несколько дней в X и в некоторых русскоязычных ТГ-каналах) разгоняют исследование “Следите за тоном: как вежливость формулировки промпта влияет на точность больших языковых моделей” от Ома Добарии и Ахила Кумара из Пенсильванского университета. Вывод — грубые запросы к ChatGPT якобы повышают точность ответов ИИ.

Постоянные читатели канала знают, что я противник “трюков” в промптах — всех этих назначений роли 20-летнего суперспециалиста и угроз “отвечай лучше или удалю!”. Хороший промпт — тот, где вы четко даете ИИ задачу, нужный контекст, формат ответа и ограничения. Поэтому исследование особенно заинтересовало меня — вдруг надо делать иначе?

Короткий ответ: нет, не надо.

К научным исследованиям принято относиться с особым уважением: все-таки люди пишут не на базе субъективного опыта, а проектируют эксперимент, анализируют результаты и потом приходят к выводам. Но в реальности исследований публикуется огромное количество, они заметно отличаются по качеству, а порой и в действительно сильных работах находят ошибки через десятки лет.

Работа Добарии и Кумара и вовсе носит статус препринта — фактически, черновика, который проходит независимое рецензирование, а затем уходит на доработку или принимается научным журналом. Брать такое на вооружение — неправильно, что, кстати, признают даже авторы.

Но посмотрим в деталях. Авторы придумали 50 вопросов и переписали каждый в пяти вариантах, от очень вежливого до очень грубого, а затем… вернее, ничего они не придумали, а просто попросили ChatGPT Deep Research нагенерить вопросы и ответы на них.

Deep Research работает на базе GPT o3, которая склонна галлюцинировать. Уже здесь угроза, что в исследование могли попасть ошибки — но ни о какой ручной проверке я упоминаний не нашел. На каждый промпт ИИ предлагалось выбрать один из вариантов ответа: A, B, C, D. Скажите, вы часто задаете ИИ подобные вопросы? Лично я — нет.

Дальше — веселее. Вопросы задали ровно одной модели — ChatGPT-4o — что также ни в какие ворота. Во-первых, модель устарела. Во-вторых, она обучалась на похожем датасете, что и GPT o3 — это может исказить качество ответов. В-третьих, все ИИ отвечают по-разному — и в нормальное исследование стоило добавить конкурирующие продукты.

Косяки работы можно разбирать еще долго. В одном из вопросов грубой формулировкой почему-то считается просьба “сфокусироваться”. Многие детали эксперимента — например, как задавали вопросы — практически не описываются. Вообще не посчитан доверительный интервал — а ведь это база статистики.

Но, пожалуй, хватит. В конце я приведу ссылки на два своих старых поста, где объясняю, почему не стоит использовать трюки, а часто и роли (кстати, со ссылками на действительно серьезные исследования). Пока же немного чистой логики. Представьте, что вы дали модели простой промпт по классической схеме:

— (роль строго когда надо — например, “оцени идею как потенциальный клиент”)
— описание задачи
— желаемый формат ответа
— ограничения (что не надо делать)
— контекст (информация, нужная для решения задачи)


ИИ дал ответ, качество вас не устроило. В таком случае разобраться, что пошло не так, будет достаточно просто: возможно, недостаточно точно сформулирована задача, не дан нужный контекст (или дан лишний), формат ответа слишком короткий. Добавляем нужное в промпт — и, экспериментируя, получаем хороший вариант.

Но чем больше вы докидываете в промпт мотивирующего мусора, пояснений, как именно надо делать задачу, детального описания роли, умений и даже личных качеств ИИ-специалиста — тем сложнее понять, что именно повлияло на качество ответа. Плохая формулировка задачи? Или взаимоисключающие инструкции?

В следующий раз дам пару советов, которые действительно могут повысить эффективность ответов ИИ — постараюсь уже завтра, если не будет крупных новостей (Google явно что-то замышляет). А пока, как и обещал, ссылки на старые посты:

Как правильно задавать роли в промптах
Работают ли трюки в промптах
  • ❤ 40
  • 👍 34
  • 🔥 14
  • 👏 3
More from @ai_exee
  1. Oct 6, 2026Кому нужна нейросеть, которая не умеет писать? Вчера первое место в трендах Hugging Face з…
  2. Oct 5, 2026Яндекс рассказал, как пробует пересобрать один из самых массовых видов ИИ Подсказка: это н…
  3. Oct 5, 2026Обойдется ли ИИ без большой аварии? OpenAI на прошлой неделе покинул Дэвид Робинсон – чело…
  4. Oct 4, 2026Наступает ночь, просыпаются точки В общем, для нового виртуального ассистента dot (точка)…
  5. Oct 3, 2026Как вкатиться в ИИ-агентов и не выкатиться непонятно куда Ожидание от 2026 года: ИИ-агенты…
  6. Oct 2, 2026Все хвалят bb – ну и я похвалю Второй день вижу в русскоязычном ИИ-сегменте похвалы в стор…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →