TGViewer
Женя, расскажи про AI Женя, расскажи про AI @that_ai_guy · 374 subscribers
Post #65 377
MCP вам не бро 1/2

В посте про dev-browser я ругался на Model Context Protocol (MCP), но правда ли он такая проблема? Спойлер: да, правда, и, вероятно, бóльшая, чем вы могли себе представить.

Посмотрите на картинку. На ней видно, как GPT-5 справляется с задачами поиска вхождений при разном количестве контекста.

Давайте разберём, что каждая из задач значит.

1. S-NIAH (Single-Needle in a Haystack)

Простыми словами:
в этой задаче модели передаётся длинный текст (стог сена),и в нём есть ОДНА нужная фраза (иголка). Нужно просто найти её и повторить.

Предположим, что вы передали в контекст модели целую книгу про Гарри Поттера и где-то между строк спрятали пароль от вашего компьютера. Затем попросили модель: «Найди в этом тексте пароль от компьютера».

Как вы можете видеть на графике, вне зависимости от количества и типа контекста, GPT-5, как, впрочем, и большинство современных моделей, ответят вам на такой вопрос правильно со 100% вероятностью.

2. OOLONG

Простыми словами:
в этой задаче модели нужно собрать статистику по всему тексту.

В этой задаче много релевантных кусочков информации разбросаны по всему контексту, и модели нужно классифицировать/посчитать/сгруппировать все эти кусочки и выдать результат.

Пример запроса: «В этом документе лежат отчёты за 90 дней. Посчитай, сколько дней в документе упоминаются проблемы с инфраструктурой и какой это процент от всех дней».

Если говорить на языке разработки, то мы даём модели задачу: «Найди все места в коде, где используется тип "any", и выведи их количество».

И тут у моделей уже начинаются проблемы. Если вы хотя бы раз ставили модели задачу поиска большого количества вхождений в тексте, то знаете, что модель почти наверняка пропустит одно или несколько вхождений даже в коротком тексте, не говоря уже о чём-то более-менее длинном.

Это прекрасно видно на графике: даже при 8 000 токенов (где-то 20 страниц текста или одна глава книги) модель с 10% вероятностью пропустит хотя бы одно вхождение, а если забить все 262 000 токенов контекстом (примерно одна книга), то вероятность ошибки увеличится до 70%.

3. OOLONG-Pairs

Простыми словами:
это усложнённая версия OOLONG, в которой модели важно не просто "прочитать всё", а найти логически связанные пары.

Так, например, в большом документе есть запись: «Дима взял задачу по оптимизации базы данных». Через 20 страниц: «Оптимизация базы данных была завершена за 3 дня». Модель должна связать «Дима», «задау» «оптимизация базы данных» и «завершена за 3 дня» в логическую цепочку, даже если они далеко друг от друга.

Пример запроса: «Найди в этом отчёте все задачи, которые выполняли разработчики за этот месяц. В ответе выведи таблицу с тем, кто, когда и какие задачи взял, а также время, которое потребовалось для выполнения задачи».

Если мы говорим про разработку, то почти любая задача, которую вы можете поставить агенту, будет попадать под эту категорию, так как код имеет очень сильную связность. Небольшое изменение в одном месте может сломать функционал в совершенно другом, а иногда даже в другом проекте.

Если мы посмотрим на график, то при 8 000 токенов контекста вероятность ошибки составляет 20%. На 16 000 токенов контекста вероятность ошибки уже 40%, а на 33 000 токенах так и вовсе — 95% 🤯.

Для полноты картины важно понимать, что GPT-5 отлично работает с контекстом, и у других передовых моделей вы увидете похожие результаты.
  • 👍 4
  • ❤ 3
  • 🔥 3
More from @that_ai_guy
  1. Mar 13, 2026AlphaEvolve от Google DeepMind открыла новые нижние оценки для чисел Рамсея, улучшив резул…
  2. Mar 12, 2026В продолжение постов об исследованиях от METR На скриншоте — количество задач, которые мы…
  3. Mar 9, 2026Мы получили Cyberpunk 2077 в реальной жизни до выхода GTA 6 Помните бреиндансы из Cyberpun…
  4. Mar 7, 2026Кринж-METR 2/2 10 июля 2025 года METR выпускает новое исследование «Measuring the Impact o…
  5. Mar 7, 2026Кринж-METR 1/2 Есть такая организация, и вы сто процентов о ней слышали, если последний го…
  6. Mar 6, 2026Про качество кода от моделей Сегодня на созвоне вскользь поднимали тему качества кода от м…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →