В этом посте поговорим про промпт-инжиниринг. В мае 2025 года Microsoft Research и Salesforce опубликовали статью «LLMs Get Lost in Multi-Turn Conversation» - времени прошло немало, протестированные LLM уже не в моде, однако выводы очень интересные. Собственно суть:
Исследователи взяли пучок LLM ( в т.ч. и топы вроде GPT-4.1, GPT o3, Claude 3.7 Sonnet, Gemini 2.5 Pro и Flash, DeepSeek-R1 и т.д.) и прогнали через них 200 000+ симулированных диалогов, с одним и тем же набором задач: код, SQL, математика, резюмирование. Но информация подавалась двумя разными способами: целиком в одном сообщении (single-turn) и по кускам в несколько заходов (собственно тот самый "multi-turn conversation" из названия исследования).
Результат: подход "всё сразу" показывает в среднем на 39% лучшую производительность чем "по частям", причем у всех: у моделей маленьких и больших, размышляющих и не очень.
Что происходит:
⬖ При уточнении задачи в последующих сообщениях, модель пытается "встроить" их в существующие ответы, создавая франкенштейна из прошлых предположений и новых правок.
⬖ Свернуть не туда достаточно один раз, дальше модель скатывается по скользкой дорожке (цитирую: when LLMs take a wrong turn, they get lost and do not recover).
Что точно не помогает (исходя из исследования):
⬖ Размышления (тут кстати любопытный момент - Gemini 2.5 Pro не была упомянута авторами как думающая, мама миа, считай нашел косяк в именитой статье) не помогают, а скорее затрудняют дело (больше мыслей - больше предположений и метаний).
⬖ Снижение температуры до нуля.
⬖ Промпт-прием вроде "повтори всё сказанное в последнем сообщении" дает прирост +15-20%, но до уровня single-turn не дотягивает.
Выводы:
Золотое правило "чем короче - тем лучше" заиграло новыми красками за пределами деградации контекста (неэффективная обработка информации в рамках контекстного окна - context rot).
Другое золотое правило "без ТЗ - результат ХЗ" было повторно апробировано.
Что делать:
Не знаете чего хотите - собираете контекст в одном чате, а потом начинаете новый чат с четкой задачей.
#prompting