TGViewer
Kantor.AI Kantor.AI @kantor_ai · 12.2K subscribers
Post #811 3.84K
Промпт "ты - эксперт" не повышает точность ответов LLM

Гайды по промптингу, особенно в материалах свежеиспеченных AI-экспертов, советуют начинать промпт с роли: "Ты - опытный юрист", "Ты - senior data scientist". Zheng, Pei и др. (Findings of ACL) еще в 2023-2024 году проверили, влияет ли это на точность в задачах с проверяемым ответом. https://arxiv.org/abs/2311.10054

Для экспериментов выбрали 162 роли: 112 профессий (юрист, геолог, "Medical Diagnostic AI", "helpful assistant") и 50 социальных (мать, коллега, друг). В исследовании участвовало 9 моделей: Flan-T5-XXL, Llama-3 8B и 70B, Mistral-7B, Qwen2.5 от 3B до 72B. Для оценки точности использовали 2410 вопросов MMLU. Форматы "Ты - {роль}" и "Ты разговариваешь с {роль}", контроль - вопрос без роли.

В результате выяснилось, что точность ответов либо на том же уровне, что и без ролей, либо хуже. Более того, можно было ожидать, что в более крупных моделях польза от ролей будет больше, но не тут-то было: вышло прямо наоборот, «вредных» ролей из всего эксперимента оказалось еще больше для моделей с бОльшим количеством параметров.

Тут резонно заметить, что ссылаться на статью с последним апдейтом в 2024 году это очень сильно замороженная рыба для темпов развития ИИ в наше время, поэтому если пост соберет 50 сердечек, напишу, что еще интересного публиковали про исследование ролей в последние два года.
arXiv.org When "A Helpful Assistant" Is Not Really Helpful: Personas... Prompting serves as the major way humans interact with Large Language Models (LLM). Commercial AI systems commonly define the role of the LLM in system prompts. For example, ChatGPT uses ``You are...
  • ❤ 160
  • 😁 10
  • ❤‍🔥 5
  • 🤔 3
  • 💯 1
More from @kantor_ai
  1. Sep 20, 2026Александр Поваров — золотой медалист международной олимпиады школьников по искусственному…
  2. Sep 20, 2026В продолжение темы олимпиад: если думаете, что посмотреть в выходной, у нас как раз вышел…
  3. Sep 19, 2026Венгерское чудо начала XX века, часть 2 Согласно легенде, как-то раз, работая в Лос-Аламос…
  4. Sep 19, 2026Границы морального в словесной эквилибристике корпоративного менеджера Как-то так получило…
  5. Sep 18, 2026Всё ли сгенерированное с помощью нейронки — нейрослоп? Может показаться, что это безобидны…
  6. Sep 17, 2026Где ИИ-агенты реально помогают, а где создают новые риски ⤵️ Узнайте на GoCloud Tech 2026…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →