Замечали, как модели отвечают хуже на уточняющие вопросы? Это не ваша паранойя — теперь у нас есть железные доказательства.
Исследование Microsoft + Salesforce «LLMs Get Lost in Multi-turn Conversation» разрушило иллюзии
- Минус 39% точности при переходе от одиночного промпта к диалогу
- Плюс 112% к разбросу качества — от гениальных ответов до полного бреда
- Все топовые модели (GPT-4.1, Claude 3, Gemini 2.5) страдают одинаково
Почему это происходит
Дело в потере контекста. LLM:
- делают поспешные выводы
- забывают середину разговора
- зацикливаются на своих ошибках
- пытаются предсказать, к чему вы клоните
Интересно, что даже режимы thinking и снижение температуры не помогают. Проблема глубже — в самой архитектуре моделей.
200 000+ диалогов показали — модели теряются уже на втором шаге. Даже когда им напоминали весь предыдущий разговор.
Практические выводы
- Хотите стабильности — упаковывате всё в один промпт
- Если чат поехал — проще начать новый, чем объяснять заново
- Многоходовые диалоги — это казино, пока технологию не улучшат
- Разработчикам пора перестать фиксироваться на single-prompt accuracy
И важный момент для создателей автономных агентов: в многоагентных системах модели не только "теряют" контекст. Они буквально теряются в нём, как в лабиринте - забывают, что было раньше и зачем они что-то делают.
Эх, а я раньше считал что последовательный диалог и уточнение деталей лучше, чем один большой промпт. Был не прав. Сам часто замечаю в задачах вайбкодинга: проще начать новый чат с хорошим контекстом прошлой работы, чем продолжать орать на модель, что она тупая.
@aimastersme
