Post #1001
125

Я увидел обсуждения в одном из чатов про SWE-2 и сначала вообще не понял, что за инструмент, но стало интересно. Новая модель, очередная IDE или второй Devin.
Полез разбираться. А там уже целый комбайн, подобный тому, который каждый из нас пытается организовать для закрытия задач разработки сервисов.
SWE-2 это модель для программирования. Devin это агент, который получает задачу, лезет в репозиторий, пишет код, гоняет тесты и приносит готовый PR. А Devin Desktop это бывший Windsurf, который Cognition купила в прошлом году и теперь превращает в пульт управления командой ИИ разработчиков.
Cursor и Claude Code помогают тебе писать код. Devin предлагает сделать шаг назад от клавиатуры и просто раздать работу агентам.
Особый интерес у меня вызвал Fusion.
Схема простая. Дорогая модель вроде Claude Fable или GPT-6 Astra думает, принимает решения и пишет важный код. Рядом бегает более дешёвая SWE-2. Она читает файлы, ищет нужные места, запускает тесты и делает всю рутину.
Короче, архитектор больше не таскает кирпичи за овер прайс.
А это уже интересно, потому что у меня уже работает похожая схема. Fable руководит задачей, Opus пишет и исправляет код, Codex независимо проверяет результат. Cognition просто завернула такой подход в готовый продукт с терминалом, облаком, общей памятью, MCP, skills, hooks и переключением моделей прямо во время работы.
Сама SWE-2 тоже не взялась из воздуха. Cognition взяла Kimi K3 на 2,8 трлн параметров и докрутила её через reinforcement learning именно под длинные задачи разработки.
Учили не только решать задачу, но и не жечь токены впустую. Меньше шариться по репозиторию, раньше начинать работать, не гонять дорогую модель туда, где справится дешёвая.
На собственном тесте Cognition модель SWE-2 набрала 50%. Fable 5.1 получила 50,9%, GPT-6 Astra набрала 53,3%. При этом Cognition заявляет, что SWE-2 обходится сильно дешевле.
Но радоваться рано. На более свежем Terminal Bench 4 у SWE-2 только 27,3%. У Fable 55,8%, у Astra 57,9%. Да и главный красивый тест FrontierCode сделала сама Cognition.
Ну типа, убийцы Claude и Codex не случилось. Получился крепкий и относительно дешёвый работяга, которого посадили внутрь хорошего агентского комбайна.
В Devin CLI доступны модели Claude, GPT, Gemini, DeepSeek, Kimi, GLM или модели самой Cognition. Можно запустить Fusion, где одна модель рулит, а вторая копается в коде. Можно начать задачу локально, потом отправить её в Devin Cloud и закрыть ноутбук.
Стоит вход от 20 долларов в месяц. Но безлимита там нет. Есть дневные и недельные квоты, но точные цифры Cognition не раскрывает.
В сентябре 2026 года Cognition привлекла больше 2 млрд.$ при оценке 48 млрд. По данным самой компании, её годовой темп выручки уже приблизился к 900 млн.$. Бизнес на людях, которые больше не хотят сами таскать кирпичи, чувствует себя нормально.
Я пока не собираюсь пускать Devin в боевые проекты. Возьму три уже закрытые задачи. Обычный баг, небольшую фичу и мерзкий brownfield кейс. Прогоню через свою текущую связку, отдельно через SWE-2 и через Fusion.
Потом сравню не рассказы агента о том, какой он молодец, а тесты, diff, ошибки на ревью, ручную доводку и цену принятого результата.
Если Fusion даст хотя бы 30% экономии без просадки по качеству, найду ему работу. Если нет, значит я за 20 долларов ещё раз посмотрел, как кто-то красиво автоматизировал выбор следующего инструмента для автоматизации.
Полез разбираться. А там уже целый комбайн, подобный тому, который каждый из нас пытается организовать для закрытия задач разработки сервисов.
SWE-2 это модель для программирования. Devin это агент, который получает задачу, лезет в репозиторий, пишет код, гоняет тесты и приносит готовый PR. А Devin Desktop это бывший Windsurf, который Cognition купила в прошлом году и теперь превращает в пульт управления командой ИИ разработчиков.
Cursor и Claude Code помогают тебе писать код. Devin предлагает сделать шаг назад от клавиатуры и просто раздать работу агентам.
Особый интерес у меня вызвал Fusion.
Схема простая. Дорогая модель вроде Claude Fable или GPT-6 Astra думает, принимает решения и пишет важный код. Рядом бегает более дешёвая SWE-2. Она читает файлы, ищет нужные места, запускает тесты и делает всю рутину.
Короче, архитектор больше не таскает кирпичи за овер прайс.
А это уже интересно, потому что у меня уже работает похожая схема. Fable руководит задачей, Opus пишет и исправляет код, Codex независимо проверяет результат. Cognition просто завернула такой подход в готовый продукт с терминалом, облаком, общей памятью, MCP, skills, hooks и переключением моделей прямо во время работы.
Сама SWE-2 тоже не взялась из воздуха. Cognition взяла Kimi K3 на 2,8 трлн параметров и докрутила её через reinforcement learning именно под длинные задачи разработки.
Учили не только решать задачу, но и не жечь токены впустую. Меньше шариться по репозиторию, раньше начинать работать, не гонять дорогую модель туда, где справится дешёвая.
На собственном тесте Cognition модель SWE-2 набрала 50%. Fable 5.1 получила 50,9%, GPT-6 Astra набрала 53,3%. При этом Cognition заявляет, что SWE-2 обходится сильно дешевле.
Но радоваться рано. На более свежем Terminal Bench 4 у SWE-2 только 27,3%. У Fable 55,8%, у Astra 57,9%. Да и главный красивый тест FrontierCode сделала сама Cognition.
Ну типа, убийцы Claude и Codex не случилось. Получился крепкий и относительно дешёвый работяга, которого посадили внутрь хорошего агентского комбайна.
В Devin CLI доступны модели Claude, GPT, Gemini, DeepSeek, Kimi, GLM или модели самой Cognition. Можно запустить Fusion, где одна модель рулит, а вторая копается в коде. Можно начать задачу локально, потом отправить её в Devin Cloud и закрыть ноутбук.
Стоит вход от 20 долларов в месяц. Но безлимита там нет. Есть дневные и недельные квоты, но точные цифры Cognition не раскрывает.
В сентябре 2026 года Cognition привлекла больше 2 млрд.$ при оценке 48 млрд. По данным самой компании, её годовой темп выручки уже приблизился к 900 млн.$. Бизнес на людях, которые больше не хотят сами таскать кирпичи, чувствует себя нормально.
Я пока не собираюсь пускать Devin в боевые проекты. Возьму три уже закрытые задачи. Обычный баг, небольшую фичу и мерзкий brownfield кейс. Прогоню через свою текущую связку, отдельно через SWE-2 и через Fusion.
Потом сравню не рассказы агента о том, какой он молодец, а тесты, diff, ошибки на ревью, ручную доводку и цену принятого результата.
Если Fusion даст хотя бы 30% экономии без просадки по качеству, найду ему работу. Если нет, значит я за 20 долларов ещё раз посмотрел, как кто-то красиво автоматизировал выбор следующего инструмента для автоматизации.
- 👍 6
- ✍ 3














