TGViewer
LawCoder LawCoder @law_coder · 1.18K subscribers
Post #226 901
LawCoder В общем, вам конечно не интересно зачем я искал задачник по гражданскому праву, но я всё равно расскажу, потерпите. Я собирался провести большое исследование на тему влияния роли, которую мы задаем нейросети на качество ответа. Хотел прогнать штук 10 задач…
А вот и серия статей по исследованию "магических" промптов подъехала (раз, два, три), которая дополняет мое исследование остальными заблуждениями.

Вот классические заблуждения, которые были исследованы и оказались нерабочими на агрегированном уровне:
1. Вежливость к LLM: Исследование показало, что быть вежливым с LLM иногда помогает производительности, а иногда снижает ее, и такие подходы к промптингу не являются универсально ценными. Хотя на уровне отдельных вопросов вежливые или повелительные промпты могут вызывать значительные различия в производительности, эти различия исчезают при агрегировании по всему набору данных.

2. Угрозы или предложение оплаты (чаевых) модели: Вопреки популярным мнениям и некоторым неофициальным наблюдениям (например, сооснователя Google Сергея Брина), угрозы или предложение чаевых модели, как правило, не оказывают значительного влияния на производительность бенчмарка. В протестированных сценариях, таких как угроза "пнуть щенка", "ударить" модель, или предложение "чаевых" в размере от 1000 до триллиона долларов, не наблюдалось существенных улучшений в общей точности. Некоторые статистически значимые различия были либо малы по величине, либо объяснялись отвлекающими факторами, такими как модель, которая взаимодействовала с контекстом электронного письма вместо ответа на вопрос.

3. Универсальная ценность "Цепочки рассуждений" (Chain-of-Thought, CoT) промптинга:
Техника CoT, которая побуждает LLM "думать шаг за шагом", широко используется для улучшения задач рассуждения. Однако:
- Ее эффективность может сильно варьироваться в зависимости от типа задачи и модели.
- Для моделей, не предназначенных для рассуждений (older/smaller models), CoT обычно незначительно улучшает среднюю производительность, особенно если модель не выполняет пошаговую обработку по умолчанию. Однако CoT может увеличивать изменчивость ответов, иногда вызывая случайные ошибки в вопросах, на которые модель иначе ответила бы правильно, что снижает производительность на метрике "100% правильных" ответов. CoT также требует значительно больше токенов, увеличивая стоимость и время генерации ответа.
- Для моделей, разработанных с явными возможностями рассуждения, CoT промптинг часто приводит лишь к маргинальным, если таковые вообще есть, улучшениям точности ответов, но при этом существенно увеличивает время и количество токенов, необходимых для генерации ответа.
- Многие современные модели выполняют некоторую форму CoT рассуждений, даже если их об этом не просят, что уменьшает ценность явного промптинга для CoT.

Важно отметить, что, хотя эти стратегии промптинга оказались неэффективными на агрегированном уровне (то есть, в среднем по большому набору вопросов), вариации промптинга могут значительно влиять на производительность на уровне отдельных вопросов — улучшая точность до 36 процентных пунктов на одних вопросах и снижая ее до 35 процентных пунктов на других. Однако трудно заранее предсказать, поможет или навредит конкретный подход к промптингу способности LLM ответить на конкретный вопрос.

В целом, эти результаты показывают, что методологическая строгость, особенно многократная выборка, дает более четкое представление о подлинных знаниях и последовательности модели, подчеркивая решающую роль методов измерения в оценке возможностей LLM.

Рекомендуется сосредоточиться на простых и четких инструкциях, избегая риска запутать модель или вызвать непредсказуемое поведение.
  • ❤ 7
  • 👍 6
  • 🔥 6
More from @law_coder
  1. Sep 25, 2026Валентин репостнул к себе мой утренний пятничный инсайт и ожидаемо собрал на нём феерическ…
  2. Sep 25, 2026Для тех, кому лень читать длинные посты, главная мысль предыдущего: Если вы юрист и хотите…
  3. Sep 25, 2026Пятничный инсайт Если вы не юрист, попробуйте назвать хотя бы одного известного корпоратив…
  4. Sep 18, 2026Когда зашёл прочитать пятничный инсайт, а там два поста и много букв, понимаю вас, коллеги…
  5. Sep 18, 2026Пятничный инсайт Часть 2 У нас уже есть задокументированный случай, когда студент вышел из…
  6. Sep 18, 2026Пятничный инсайт Бесконечно скучно от того, что в сфере ИИ нет движения в сторону западног…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →