TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2307 141
👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели

11 сентября японская Sakana AI представила обновление Fugu Max и Fugu Ultra v2. Перед нами разные версии системы, которая сама собирает группу из нескольких ИИ-моделей и руководит её работой.

Разработчик отправляет запрос в один OpenAI-совместимый API. Внутри Fugu решает, достаточно ли одной модели или задачу следует разделить на части, кому поручить планирование, код, поиск и проверку, а затем собирает результаты в единый ответ. Оркестратор тоже является языковой моделью и при необходимости может рекурсивно вызывать другие экземпляры самого себя.

Мы часто пишем об оркестраторах, и ранее уже описывали, как работает японская Fugu. Связано это с тем, что при все большей потребности фронтирных моделей в вычислительных мощностях оркестраторы позволяют получить столь же высокое качество при более скромных расходах.

Зачем понадобились сразу Max и Ultra v2?

Обе версии построены на общей архитектуре, но оптимизируют разные показатели.

➡️ Fugu Max ищет лучшее соотношение качества и цены. Он использует крупнейший в линейке пул открытых и специализированных моделей, включая семейство NVIDIA Nemotron, и старается поручать каждый фрагмент работы самому экономичному агенту.

Цена составляет $2 за миллион входных и $6 за миллион выходных токенов. По расчётам Sakana, выход Max обходится на 40–60% дешевле Sonnet 5, GPT-5.6 Terra и Kimi K3. На шести тестах, включая Terminal Bench 2.1, GPQA Diamond и AutomationBench, система показала лучший совокупный результат «качество — стоимость».

➡️ Fugu Ultra v2 решает противоположную задачу: получить максимально сильный результат, даже если ответ потребует больше времени и вычислений. Она предназначена для автономных исследований, сложного анализа документов, программной разработки и длинных многошаговых процессов.

На Chartography, где требуется понимать сложные графики и визуальные данные, Ultra v2 получила 48,3 балла против 27,3 у Opus 5. На DeepSWE для реальной разработки ПО — 74,3. По данным Sakana, система стала первой или разделила первое место в пяти из восьми тестов.

При этом в её пул не входили Fable 5, Fable 5.1 и GPT-6 Astra. То есть оркестратор достиг заявленного уровня не потому, что просто применил внутри самую сильную доступную модель.

Чем это отличается от первой Fugu Ultra?

В июне Sakana выпустила обычную Fugu для повседневной работы и Fugu Ultra для максимального качества. Новый релиз превращает эту идею в более чёткую продуктовую развилку:
☑️ Max — минимизировать стоимость при сохранении высокого качества;
☑️ Ultra v2 — максимизировать способность решать самые сложные задачи.

Главное изменение — не новый интерфейс, а обучение оркестратора под две разные экономические цели. Однако точный состав пулов и внутренние изменения относительно первой Ultra компания не раскрывает. Пользователь также не видит, какие конкретно модели были выбраны для отдельного запроса.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 2
  • 👍 2
  • 🔥 1
More from @testuring
  1. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  2. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  3. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
  4. Sep 16, 2026🔐 У искусственного интеллекта появляется технадзор Сразу две новости, вышедшие за последн…
  5. Sep 15, 2026⚠️ Панель управления, которая собирает себя сама Runway представила Solaris — первую систе…
  6. Sep 14, 2026💊 Сколько будет стоить молодость, если ИИ создаст лекарство от старости? 7 сентября Insil…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →