TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2241 377
💥 Зачем выбирать между Claude, GPT, Gemini и DeepSeek, если можно использовать все сразу?

У каждой frontier-модели есть сильные и слабые стороны, и это давно не секрет. Например, некоторые считают, что Claude лучше рассуждает и следует инструкциям, а GPT-5.x сильнее в аналитике данных. При этом мы и сами заметили, что Gemini опережает в работе с длинными документами и поиском в сети. DeepSeek и Kimi неожиданно сильны в математике и стоят в разы дешевле.

Возникает логичный вопрос: а нельзя ли задать вопрос всем сразу и выбрать лучший ответ?

Можно. OpenRouter превратил эту идею в продукт — Fusion API. Система прогоняет запрос через 3–5 моделей одновременно. Пользователь может выбрать преднастроенный вариант Quality или Budget, и модели-участники будут работать параллельно. Также в панели включён web search, то есть каждая модель может найти актуальные данные перед ответом.

Стадии обработки запроса:
1️⃣ Ваш запрос поступает в Опенроутер ▶️ 2️⃣ несколько (от 1 до 8) моделей параллельно исполняют его, также происходит поиск в сети ▶️ 3️⃣ "судья" сравнивает все ответы ▶️ 4️⃣ финальная модель пишет итоговый текст.

Самое интересное — шаг судьи

Судья не просто выбирает лучший ответ. Судья возвращает структурированный JSON с пятью разделами:
➡️ consensus — в чём все модели согласны
➡️ contradictions — где прямо противоречат друг другу
➡️ partial coverage — что одна модель затронула, другая нет
➡️ unique insights — что нашла только одна модель
➡️ blind spots — что никто не заметил

Это уже не выбор победителя, а карта разногласий.

Реальные цифры

OpenRouter тестировал Fusion на бенчмарке DRACO: 100 задач глубокого исследования, разработан Perplexity. Панель Fable 5 + GPT-5.5 с судьёй Opus 4.8 смогла набрала 69,0%. Это выше, чем Fable 5 в одиночку — 65,3%. Бюджетная панель из Gemini 3 Flash, Kimi K2.6 и DeepSeek V4 Pro достигла 64,7% при вдвое меньшей стоимости.

Окупается ли?

Платить нужно за вызов каждой модели в панели плюс вызов судьи. Вариант "Quality" стоит больше чем в 3 раза дороже одного вызова модели Opus 4.8. Но качество превзойдет пока недоступный Fable 5. Если задача требует глубокого анализа, и ошибка обойдётся дорого, то это подходящий вариант.

Если нужен быстрый ответ на простой вопрос — один дешёвый Claude Haiku будет в сотни раз дешевле и достаточен. OpenRouter сам признаёт: Fusion не подходит для realtime-взаимодействий и задач, где важна скорость ответа — параллельный запуск нескольких моделей увеличивает задержку ответа пропорционально.

Можно ли собрать судью самостоятельно?

Технически — да, и это не очень сложно. Основа будет, например, на Python с несколькими API-ключами. Логика такая: один и тот же запрос отправляется параллельно к Claude, GPT и Gemini. Далее все три ответа собираются, формируется мета-промпт:
Вот три ответа на один вопрос. Определи: в чём они согласны, где противоречат, что каждый упустил, выбери лучшие элементы и синтезируй финальный ответ. 

Такой запрос отправляется судье — любой достаточно умной модели.

Это паттерн, давно известный как «mixture of agents» в академической литературе. Идея существует давно, но упаковать её в продуктовый API, чтобы вызывать так же, как любую одну модель - это то, что делает Fusion практически полезным.

Что OpenRouter добавляет сверх самодельной сборки: удобство, web поиск в каждой модели, пресеты из проверенных комбинаций и прозрачность логов. Сколько это стоит? 5.5% сверх стоимости всех вызовов.


Когда имеет смысл, когда нет?

Fusion работает хорошо там, где у моделей разные слепые зоны: юридический анализ, медицинское исследование, стратегические решения, глубокий фактчекинг. Модели галлюцинируют по-разному и ансамбль снижает вероятность того, что ни одна не поймала ошибку.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 2
  • 👍 2
  • 💯 2
More from @testuring
  1. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  2. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  3. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  4. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  5. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
  6. Sep 16, 2026🔐 У искусственного интеллекта появляется технадзор Сразу две новости, вышедшие за последн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →