TGViewer
law.exe law.exe @law_exe · 202 subscribers
Post #29 409
Не растягивайте диалоги с LLM

В этом посте поговорим про промпт-инжиниринг. В мае 2025 года Microsoft Research и Salesforce опубликовали статью «LLMs Get Lost in Multi-Turn Conversation» - времени прошло немало, протестированные LLM уже не в моде, однако выводы очень интересные. Собственно суть:

Исследователи взяли пучок LLM ( в т.ч. и топы вроде GPT-4.1, GPT o3, Claude 3.7 Sonnet, Gemini 2.5 Pro и Flash, DeepSeek-R1 и т.д.) и прогнали через них 200 000+ симулированных диалогов, с одним и тем же набором задач: код, SQL, математика, резюмирование. Но информация подавалась двумя разными способами: целиком в одном сообщении (single-turn) и по кускам в несколько заходов (собственно тот самый "multi-turn conversation" из названия исследования).

Результат: подход "всё сразу" показывает в среднем на 39% лучшую производительность чем "по частям", причем у всех: у моделей маленьких и больших, размышляющих и не очень.

Что происходит:
⬖ При уточнении задачи в последующих сообщениях, модель пытается "встроить" их в существующие ответы, создавая франкенштейна из прошлых предположений и новых правок.
⬖ Свернуть не туда достаточно один раз, дальше модель скатывается по скользкой дорожке (цитирую: when LLMs take a wrong turn, they get lost and do not recover).


Что точно не помогает (исходя из исследования):
⬖ Размышления (тут кстати любопытный момент - Gemini 2.5 Pro не была упомянута авторами как думающая, мама миа, считай нашел косяк в именитой статье) не помогают, а скорее затрудняют дело (больше мыслей - больше предположений и метаний).
⬖ Снижение температуры до нуля.
⬖ Промпт-прием вроде "повтори всё сказанное в последнем сообщении" дает прирост +15-20%, но до уровня single-turn не дотягивает.


Выводы:
Золотое правило "чем короче - тем лучше" заиграло новыми красками за пределами деградации контекста (неэффективная обработка информации в рамках контекстного окна - context rot).
Другое золотое правило "без ТЗ - результат ХЗ" было повторно апробировано.

Что делать:
Не знаете чего хотите - собираете контекст в одном чате, а потом начинаете новый чат с четкой задачей.

#prompting
  • 👍 7
  • 🔥 5
More from @law_exe
  1. Sep 15, 2026Развеем тишину в канале. Пишу редко, буду стараться чаще. 13 сентября закончилась летняя а…
  2. Aug 21, 2026Я очень часто использую глубокие исследования. Почти каждый день. Это когда вместо тебя гу…
  3. Aug 20, 2026Вдогонку сброшу результат - тут инструкции для Клода, скрипты на питоне и базовая структур…
  4. Aug 20, 2026Как можно создать личную библиотеку знаний Новый тренд — собирать свою LLM-wiki. По сути,…
  5. Jul 31, 2026Все эти MMLU и HumanEval - детский сад по сравнению с реальной жизнью. Если мы хотим доказ…
  6. Jul 29, 2026Обычно такое письмо счастья от Anthropic означает, что ваша работа пошла по борозде. Я тут…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →