Пару дней назад из стелс-режима вышел новый стартап - Deep Cogito. И на него стоит обратить внимание, потому что он не только основан выходцами DeepMind и Google, но еще ставит перед собой довольно дерзкую цель: переосмыслить масштабирование LLM.
Ранее я писал про SPCT от DeepSeek, где модель учится сама формулировать принципы хорошего ответа для конкретного запроса, а затем критиковать свой ответ по этим принципам. И вот теперь Deep Cogito выкатывает свой взгляд на улучшение моделей с релизом Cogito v1 (линейка от 3B до 70B параметров), который тоже основан на идее самосовершенствования, но с другим фокусом. Называется он IDA (Iterated Distillation and Amplification).
Что это за подход?
Вот здесь интересно сравнить с SPCT. Если SPCT учит модель быть лучшим оценщиком через самокритику по выработанным принципам, то IDA, судя по описанию, нацелен на улучшение самой генерирующей модели.
Как это работает:
- Сначала модель генерирует ответы, используя более интенсивные вычисления и "рассуждения" (упоминают recursive thinking). То есть, она как бы "думает усерднее", чтобы получить ответ более высокого качества.
- Затем эти улучшенные ответы (а точнее, способность их генерировать) дистиллируются обратно в параметры самой модели, становясь ее встроенными возможностями.
Получается, это своего рода само-дистилляция через рассуждения: модель сама для себя создает улучшенные примеры и учится на них. В отличие от SPCT, где фокус на генерации принципов оценки и критики, здесь фокус на генерации улучшенного конечного результата и его интеграции в модель. Оба метода - шаг в сторону от классического подхода к обучению, попытка научить модели улучшаться через более сложные внутренние процессы.
Какие плюсы приписывают IDA
1. Потенциально более масштабируемо и не ограничено качеством фидбэка от людей или возможностями модели-учителя. Модель сама себе поднимает планку.
2. Скорость разработки. Заявляют, что 70B модель сделали всего за 75 дней, и она якобы обгоняет LLaMA 4 109B MoE по ключевым бенчмаркам. (хотя выяснилось, что у LLaMA цифры были нарисованные)
В чем еще фишка моделей Cogito
Данные модельки умеют переключаться между стандартным режимом (для скорости) и режимом reasoning для сложных задач. Идея в том, чтобы решить классическую проблему: либо быстро, либо "умно" и ресурсозатратно. Чтобы включить ризонинг-режим в системный промпт надо ввести:
Enable deep thinking subroutine.
Deep Cogito заявляют, что их модели превосходят лучших конкурентов в каждой весовой категории (упоминают аналоги от LLaMA, DeepSeek, Qwen). Их флагманская Cogito 70B, по словам компании, обходит не только LLaMA 3.1 70B (дистиллированную с 405B модели), но и Llama 4 109B MoE (Scout), дистиллированную с гигантской 2T модели Llama 4 Behemoth.
Я уже успел немного пощупать младшие модели – Cogito 8B и 14B. И по первым ощущениям, они действительно выглядят очень достойно на фоне конкурентов схожего размера.
Из плюсов бы отметил:
1. Скорость генерации на пару токенов в секунду выше
2. Ощутимо лучше работают с русским языком, практически не уступают YandexGPT
3. Понравилась возможность переключения между режимами. И Reasoning в 14b модели мне понравился больше, чем у DeepSeek