TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2123 487
🖥 Как «умные надстройки» побеждают гигантские модели

Команда ARC Prize официально объявила 2025 год «Годом цикла уточнения» (Year of the Refinement Loop). Если 2020–2024 годы — это эпоха масштабирования и рост за счет миллиардов параметров, то 2025 год означает начало эпохи системной оптимизации, рост за счет умной оркестровки и алгоритмов на уровне приложения.

Яркий пример — триумф стартапа Poetiq. Система от этой лаборатории набрала 75% на тесте ARC-AGI-2, фактически достигнув сверхчеловеческого уровня. При этом у Poetiq нет своих ИИ-моделей, они берут лучшие базовые решения, например, GPT-5.2 или Gemini 3 Pro, и «разгоняют» их через уникальный пайплайн.

Тест ARC-AGI-2 (Activity Recognition Challenge Artificial General Intelligence version 2) относится к серии тестов, разработанных для оценки способности ИИ-систем распознавать человеческие активности, эмоции и намерения путем анализа изображений, видео и других мультимедийных материалов.


Кейс Poetiq: как работает Meta-System

Вместо обучения новых моделей Poetiq создала интеллектуальную оболочку, работающую через итеративные циклы уточнения.

Архитектура процесса состоит из 5 шагов:
➡️ Generation: модель выдает черновик решения.
➡️ Self-Auditing: ключевая инновация — система сама решает, достаточно ли данных и качественный ли получился ответ.
➡️ Feedback Analysis: анализ ошибок и поиск путей улучшения.
➡️Refinement: использование LLM для точечного исправления ответа на базе фидбека.
➡️Verification: финальная проверка и повтор цикла при необходимости.

Результаты впечатляют:
✅ повышение производительности Gemini 3 Pro в 1,74 раза — с 31% до 54% на ARC-AGI-2
✅ решение задачи обходится в $30.57 против $77.16 у стандартных SOTA-моделей — 60% экономии при более высоком качестве
✅ новые модели, например, GPT-5.1, интегрируются в систему за считанные часы после релиза

Poetiq не одиноки в этом подходе. Вот еще четыре компании, меняющие правила игры:

1️⃣ Together AI — Mixture of Agents (MoA)
Используют послойную архитектуру, где на каждом уровне работают несколько разных агентов. Агенты следующего слоя анализируют выходы предыдущего, корректируя и дополняя их.
Итог: превзошли GPT-4o на бенчмарке AlpacaEval 2.0 (65.1% против 57.5%), используя только открытые модели Llama и Qwen.

2️⃣ Sakana AI — AI Scientist & Model Breeding
Пошли путем автоматизации самой науки и эволюционных алгоритмов. Система «скрещивает» существующие модели (Model Breeding) и проводит полный цикл исследований — от идеи до написания научной статьи с peer-review. Итог: создание качественных научных работ без участия человека.

3️⃣ Nous Research — Распределенное обучение (DisTrO)
Сфокусировались на децентрализации и ансамблях экспертов.
Технология HDEE обучает экспертов независимо и объединяет их в конце, позволяя любому GPU участвовать в процессе без сложной синхронизации. Итог: модели серии Hermes бьют базовые решения на 20 из 21 тестового домена при том же бюджете.

4️⃣ Not Diamond — Smart Routing
Создали мета-модель, которая выступает «умным диспетчером». Роутер анализирует запрос и выбирает оптимальную модель (Claude, GPT, Gemini) или их каскад. Итог: точность 94.3% при стоимости в 20 раз ниже, чем у GPT-4.

Успех всех этих кейсов строится на следующих принципах:

Композиция > масштабирование: умное сочетание моделей эффективнее, чем простое увеличение их размера.
Test-time compute: больше вычислений во время выдачи ответа, а не только при обучении.
Специализация: каждый компонент делает то, в чем он силен.
Feedback loops: итеративное самообучение системы на каждой решенной задаче.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 2
  • 👍 1
  • 🔥 1
More from @testuring
  1. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  2. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  3. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  4. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  5. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  6. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →