TGViewer
Aimasters.Me ◽️ Aimasters.Me ◽️ @aimastersme · 6.82K subscribers
Post #354 1.99K
LLM тупеют от долгих разговоров

Замечали, как модели отвечают хуже на уточняющие вопросы? Это не ваша паранойя — теперь у нас есть железные доказательства.

Исследование Microsoft + Salesforce «LLMs Get Lost in Multi-turn Conversation» разрушило иллюзии

- Минус 39% точности при переходе от одиночного промпта к диалогу
- Плюс 112% к разбросу качества — от гениальных ответов до полного бреда
- Все топовые модели (GPT-4.1, Claude 3, Gemini 2.5) страдают одинаково

Почему это происходит

Дело в потере контекста. LLM:
- делают поспешные выводы
- забывают середину разговора
- зацикливаются на своих ошибках
- пытаются предсказать, к чему вы клоните

Интересно, что даже режимы thinking и снижение температуры не помогают. Проблема глубже — в самой архитектуре моделей.

200 000+ диалогов показали — модели теряются уже на втором шаге. Даже когда им напоминали весь предыдущий разговор.

Практические выводы

- Хотите стабильности — упаковывате всё в один промпт
- Если чат поехал — проще начать новый, чем объяснять заново
- Многоходовые диалоги — это казино, пока технологию не улучшат
- Разработчикам пора перестать фиксироваться на single-prompt accuracy

И важный момент для создателей автономных агентов: в многоагентных системах модели не только "теряют" контекст. Они буквально теряются в нём, как в лабиринте - забывают, что было раньше и зачем они что-то делают.

Эх, а я раньше считал что последовательный диалог и уточнение деталей лучше, чем один большой промпт. Был не прав. Сам часто замечаю в задачах вайбкодинга: проще начать новый чат с хорошим контекстом прошлой работы, чем продолжать орать на модель, что она тупая.


@aimastersme
  • ❤ 17
  • 😁 4
  • 😢 4
More from @aimastersme
  1. Oct 8, 2026Словарь ИИ-терминов Помните рубрику, где я простыми словами разбирал сложные термины? Терм…
  2. Oct 7, 2026Сказ о том, как я IT-визу получал Я уже третий год живу в Узбекистане. За это время зареги…
  3. Oct 7, 2026Claude в Google Docs, Sheets и Slides Новость из разряда максимально прикладных Я до сих п…
  4. Oct 5, 2026Ива стала проактивной v.0.4.12 До сих пор она работала как хороший, но стеснительный секре…
  5. Sep 29, 2026Sonnet 5.5 запустил на сложной кодовой задаче. Справился на уровне DeepSeek 4.1 А если нет…
  6. Sep 28, 2026Hemmingway-1 против слопа Раньше я советовал вам skill humanizer-ru. Он и правда работает…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →