Команда ARC Prize официально объявила 2025 год «Годом цикла уточнения» (Year of the Refinement Loop). Если 2020–2024 годы — это эпоха масштабирования и рост за счет миллиардов параметров, то 2025 год означает начало эпохи системной оптимизации, рост за счет умной оркестровки и алгоритмов на уровне приложения.
Яркий пример — триумф стартапа Poetiq. Система от этой лаборатории набрала 75% на тесте ARC-AGI-2, фактически достигнув сверхчеловеческого уровня. При этом у Poetiq нет своих ИИ-моделей, они берут лучшие базовые решения, например, GPT-5.2 или Gemini 3 Pro, и «разгоняют» их через уникальный пайплайн.
Тест ARC-AGI-2 (Activity Recognition Challenge Artificial General Intelligence version 2) относится к серии тестов, разработанных для оценки способности ИИ-систем распознавать человеческие активности, эмоции и намерения путем анализа изображений, видео и других мультимедийных материалов.
Кейс Poetiq: как работает Meta-System
Вместо обучения новых моделей Poetiq создала интеллектуальную оболочку, работающую через итеративные циклы уточнения.
Архитектура процесса состоит из 5 шагов:
➡️ Generation: модель выдает черновик решения.
➡️ Self-Auditing: ключевая инновация — система сама решает, достаточно ли данных и качественный ли получился ответ.
➡️ Feedback Analysis: анализ ошибок и поиск путей улучшения.
➡️Refinement: использование LLM для точечного исправления ответа на базе фидбека.
➡️Verification: финальная проверка и повтор цикла при необходимости.
Результаты впечатляют:
✅ повышение производительности Gemini 3 Pro в 1,74 раза — с 31% до 54% на ARC-AGI-2
✅ решение задачи обходится в $30.57 против $77.16 у стандартных SOTA-моделей — 60% экономии при более высоком качестве
✅ новые модели, например, GPT-5.1, интегрируются в систему за считанные часы после релиза
Poetiq не одиноки в этом подходе. Вот еще четыре компании, меняющие правила игры:
1️⃣ Together AI — Mixture of Agents (MoA)
Используют послойную архитектуру, где на каждом уровне работают несколько разных агентов. Агенты следующего слоя анализируют выходы предыдущего, корректируя и дополняя их.
Итог: превзошли GPT-4o на бенчмарке AlpacaEval 2.0 (65.1% против 57.5%), используя только открытые модели Llama и Qwen.
2️⃣ Sakana AI — AI Scientist & Model Breeding
Пошли путем автоматизации самой науки и эволюционных алгоритмов. Система «скрещивает» существующие модели (Model Breeding) и проводит полный цикл исследований — от идеи до написания научной статьи с peer-review. Итог: создание качественных научных работ без участия человека.
3️⃣ Nous Research — Распределенное обучение (DisTrO)
Сфокусировались на децентрализации и ансамблях экспертов.
Технология HDEE обучает экспертов независимо и объединяет их в конце, позволяя любому GPU участвовать в процессе без сложной синхронизации. Итог: модели серии Hermes бьют базовые решения на 20 из 21 тестового домена при том же бюджете.
4️⃣ Not Diamond — Smart Routing
Создали мета-модель, которая выступает «умным диспетчером». Роутер анализирует запрос и выбирает оптимальную модель (Claude, GPT, Gemini) или их каскад. Итог: точность 94.3% при стоимости в 20 раз ниже, чем у GPT-4.
Успех всех этих кейсов строится на следующих принципах:
Композиция > масштабирование: умное сочетание моделей эффективнее, чем простое увеличение их размера.
Test-time compute: больше вычислений во время выдачи ответа, а не только при обучении.
Специализация: каждый компонент делает то, в чем он силен.
Feedback loops: итеративное самообучение системы на каждой решенной задаче.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
