Ты только что отправил аналитику боссу. Два часа в Copilot: источники собраны, структура есть, выглядит убедительно. Нажал отправить. В тот же день Microsoft показал данные: та же задача с двумя AI-ревьюерами давала итоговый показатель исследования на 13,8% выше. Ты узнал это после.
С 30 марта 2026-го в Copilot Researcher два новых режима. Critique: GPT пишет черновик, Claude читает и ищет ошибки, потом GPT исправляет. Council: обе модели работают одновременно, независимо, результаты рядом. Логика простая: у GPT и Claude разные слепые пятна. Там, где один пропускает, второй замечает. Это уже не теория многоагентных систем: Microsoft задокументировал это на промышленном бенчмарке.
Бенчмарк называется DRACO (Deep Research Accuracy, Completeness and Objectivity, стандарт оценки качества глубокого исследования).
10 доменов: медицина, технологии, право. Совместная работа двух моделей дала статистически значимое улучшение в 8 из 10. По глубине анализа, качеству изложения и фактической точности Critique обогнал одиночные системы от OpenAI, Google, Perplexity и Anthropic.
Фактура:
+Critique против лучшего одиночного конкурента: Perplexity Deep Research на Claude Opus 4.6 отстаёт на +7,0 баллов (SEM ±1,90) в агрегированном DRACO-score, что составляет +13,88% ++ Разбивка прироста: глубина анализа +3,33, качество изложения +3,04, фактическая точность +2,58 +++ Статистически значимое улучшение (paired t-test, p < 0,05) в 8 из 10 доменов; в технологиях и юриспруденции улучшение не достигло порога значимости ++++ Council специально для сравнения: два отчёта рядом, пользователь сам видит, где GPT и Claude расходятся в фактах, источниках и интерпретациях +++++ Critique и Council сейчас в Frontier-плане M365 Copilot; широкий роллаут на все лицензии запланирован на Q2 2026
И что?
Если используешь Copilot Researcher для задач, которые влияют на решения: включи Critique. Для продуктов и агентов, которые строишь сам на одной модели и продаёшь на точность: это первый промышленный бенчмарк, который документирует разрыв между single- и multi-model проверкой. Клиенты начнут задавать этот вопрос. Лучше иметь ответ заранее.
Нам 3.14здец:
Если строишь AI-продукт с single-model архитектурой и позиционируешь его на точность выводов: 7/10. Microsoft только что задокументировал разрыв публично. Конкуренты с multi-agent ревью начнут использовать эти данные в продажах. Либо добавляй validation layer, либо меняй позиционирование. Выбирай сам.
Post #2247
938

- ❤ 1