Про роли в промптах, часть 2Продолжая
предыдущий пост, основное на мой взгляд наблюдение дано в конце статьи: хоть роли, улучшающие ответ, и были, выбор роли под вопрос оказался сложной задачей. Если собрать оракула, который знает, какая роль лучшая, получается заметный прирост точности. Но вот попытки сначала честно подобрать роль увы не дали результата лучше, чем её случайный выбор.
В жизни мы прописываем в промпте роль, понимая, что хотим получить от LLM (и даже до точной формулировки вопроса), поэтому проблема выбора роли как будто бы частично снимается. Кроме того, роль мы прописываем не просто для более точного ответа, а для более уместной стилистики. Таким образом, тезис «роли не работают» ничуть не лучше инфоцыганского «всегда пишите роль». И то и то передергивание, а в результатах, если добавить другие исследования, есть существенный разброс.
Кратко что в других публикациях 2024-2025 года:Kong et al., NAACL 2024, "Better Zero-Shot Reasoning with Role-Play Prompting" - аргумент сторонников ролей. Двухшаговый ролевой промпт (роль, подтверждение от модели, задача) на ChatGPT поднял, например, AQuA с 53.5% до 63.8%; авторы считают роль неявным триггером chain-of-thought. Разница постановок со статьей, что разбирали с вами ранее: там был выбор варианта в фактических вопросах, тут рассуждение с генерацией решения.
https://arxiv.org/abs/2308.07702Salewski et al., NeurIPS 2023, "In-Context Impersonation" - эксперт своего домена отвечает лучше эксперта чужого, но та же механика внезапно вытаскивает еще и стереотипы: "от лица мужчины" модель описывает автомобили лучше, чем "от лица женщины".
https://arxiv.org/abs/2305.14930Gupta et al., ICLR 2024, "Bias Runs Deep" - 24 датасета на рассуждение, 19 демографических персон. Персона роняет точность, часть ошибок - очень интересные отказы вида "как человек с инвалидностью, я не могу решить эту задачу" (58% ошибок этой персоны было у ChatGPT-3.5).
https://arxiv.org/abs/2311.04892Luz de Araujo, Röttger, Hovy, Roth, EMNLP 2025, "Principled Personas" - 9 моделей, 27 задач. Экспертная роль в среднем не вредит и иногда помогает, но есть другое наблюдение: нерелевантная деталь в описании роли (например, имя) роняет точность почти на 30 п.п. Образование, специализация и близость домена влияют непоследовательно.
https://arxiv.org/abs/2508.19764Iadisernia, Camassa (Banca d'Italia), ICAIF 2025, "Prompting for Policy" - 2368 биографий экономистов из PersonaHub, GPT-4o воспроизводит опрос профессиональных прогнозистов ЕЦБ за 50 кварталов. Без персоны ошибка прогноза та же (p=0.31), а разброс между персонами на два порядка меньше, чем между людьми.
https://arxiv.org/abs/2511.02458Что добавили свежие публикации этого года (препринты, рецензирования не было, так что продолжаем вести наблюдение):Hu, Rostami, Thomason, 2026, "Expert Personas Improve LLM Alignment but Damage Accuracy" - наконец-то задались вопросом, почему результаты исследований расходятся. На знаниевых задачах роль вредит: MMLU 68.0% против 71.6% без роли, длинное описание хуже короткого. На задачах про формат, тон и отказы (письмо, извлечение данных, jailbreak-бенчмарки) роль помогает, и чем длиннее, тем сильнее: +17.7 п.п. отказов на JailbreakBench с ролью "safety monitor". Гипотеза в том, что длина контекста просто дает LLM сигнал «надо рассуждать». Что меня смущает в этой статье: она хоть и марта 2026 года, а исследует модели, которые с нами с начала 2025, да и в целом большие модельки не трогает, только их дистилляты.
https://arxiv.org/abs/2603.18507"When Does Persona Prompting Actually Help?", 2026 - 1140 открытых вопросов, 38 ролей, оценка LLM-судьей. Роль повышает "глубину экспертизы" и структурность, снижает ясность и прямоту. Выигрывает в консультативных доменах (медицина, психология), проигрывает на объяснительных вопросах.
https://arxiv.org/abs/2605.29420Итого:Роль в промпте может быть полезна для тона, формата, стилистики и границ поведения. Если нужен факт или расчет, роль может быть лучше убрать или сократить до одной фразы.