TGViewer
Грин еще не робот 🤖 Грин еще не робот 🤖 @robotless · 5.11K subscribers
Post #2247 938
Ты только что отправил аналитику боссу. Два часа в Copilot: источники собраны, структура есть, выглядит убедительно. Нажал отправить. В тот же день Microsoft показал данные: та же задача с двумя AI-ревьюерами давала итоговый показатель исследования на 13,8% выше. Ты узнал это после.

С 30 марта 2026-го в Copilot Researcher два новых режима. Critique: GPT пишет черновик, Claude читает и ищет ошибки, потом GPT исправляет. Council: обе модели работают одновременно, независимо, результаты рядом. Логика простая: у GPT и Claude разные слепые пятна. Там, где один пропускает, второй замечает. Это уже не теория многоагентных систем: Microsoft задокументировал это на промышленном бенчмарке.
Бенчмарк называется DRACO (Deep Research Accuracy, Completeness and Objectivity, стандарт оценки качества глубокого исследования).

10 доменов: медицина, технологии, право. Совместная работа двух моделей дала статистически значимое улучшение в 8 из 10. По глубине анализа, качеству изложения и фактической точности Critique обогнал одиночные системы от OpenAI, Google, Perplexity и Anthropic.

Фактура:

+Critique против лучшего одиночного конкурента: Perplexity Deep Research на Claude Opus 4.6 отстаёт на +7,0 баллов (SEM ±1,90) в агрегированном DRACO-score, что составляет +13,88% ++ Разбивка прироста: глубина анализа +3,33, качество изложения +3,04, фактическая точность +2,58 +++ Статистически значимое улучшение (paired t-test, p < 0,05) в 8 из 10 доменов; в технологиях и юриспруденции улучшение не достигло порога значимости ++++ Council специально для сравнения: два отчёта рядом, пользователь сам видит, где GPT и Claude расходятся в фактах, источниках и интерпретациях +++++ Critique и Council сейчас в Frontier-плане M365 Copilot; широкий роллаут на все лицензии запланирован на Q2 2026

И что?
Если используешь Copilot Researcher для задач, которые влияют на решения: включи Critique. Для продуктов и агентов, которые строишь сам на одной модели и продаёшь на точность: это первый промышленный бенчмарк, который документирует разрыв между single- и multi-model проверкой. Клиенты начнут задавать этот вопрос. Лучше иметь ответ заранее.

Нам 3.14здец:
Если строишь AI-продукт с single-model архитектурой и позиционируешь его на точность выводов: 7/10. Microsoft только что задокументировал разрыв публично. Конкуренты с multi-agent ревью начнут использовать эти данные в продажах. Либо добавляй validation layer, либо меняй позиционирование. Выбирай сам.
  • ❤ 1
More from @robotless
  1. Sep 29, 2026Принято считать, что новые компании, особенно стартапы, создают молодые. До 30 нужно уже ч…
  2. Sep 28, 2026SpaceX впервые вывела Starship на орбиту Земли Запуск был произведен с космодрома Starbase…
  3. Sep 28, 202623 сентября. Совбез ООН. Час доклада. Ноль решений. Сэм Альтман лично, Дарио Амодеи по вид…
  4. Sep 28, 2026ООН просит, Конгресс запрещает, Калифорния выключает. ИИ тем временем открывает то, чего н…
  5. Sep 18, 2026Полночь. Ты пишешь ChatGPT то, что вслух не сказал бы никому. Тревогу за здоровье. Сомнени…
  6. Sep 18, 2026ИИ читает твои переписки и тормозит твою карьеру. Апокалипсиса для этого не нужно Сотни по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →