Ilyas Salikhov pinned «🔳▶️▶️▶️▶️▶️📦◀️◀️ Мы запустили AgentBox — облачные песочницы для ваших AI-агентов с полноценной Linux-средой. А теперь что это и для чего. Допустим, мы хотим сделать агента. Стартанули, например, на базе codex cli. И тут нужно решить ряд инфраструктурных…»
Channel Public Channel
IL - Subscribers
- 1.74K
- Photos
- 16
- Videos
- 3
- Links
- 39
Recent Posts 17 shown
Post #55
579
🔳▶️▶️▶️▶️▶️📦◀️◀️
Мы запустили AgentBox — облачные песочницы для ваших AI-агентов с полноценной Linux-средой. А теперь что это и для чего.
Допустим, мы хотим сделать агента. Стартанули, например, на базе codex cli. И тут нужно решить ряд инфраструктурных задач:
1. Безопасность. Агент может по ошибке испортить файлы в системе. А может и начать вылазить из вашего окружения. Также бывает нужно в зависимости от сессии давать разные доступы.
2. Изоляция сессий. Сессия не должна видеть данные и енвы других сессий.
3. Системные привилегии. Хорошо бы, чтобы агент мог поднимать docker-окружение проекта, если агент для разработчиков, а это требует системных привилегий. Тут кстати потребуется и изоляция, т.к. докеры разных сессий на одной машине могут начать толкаться локтями
4. Настраиваемая/подготовленная среда. Агент для решения задачи может ставить какой софт, пакеты. Или мы ему хотим заранее поставить пакеты. Пресловутые rg, jq. Но, может, и что-то более специфичное. У нас были кейсы, когда был нужен браузер.
5. Масштабируемость. Что делать, когда одной железки становится недостаточно?
6. Тестовое окружение. Для проверки агента у вас появятся evals. А их нужно где-то прогонять. Нужна воспроизводимая среда.
Мы стокнулись с этим и поняли: елки-палки, это в любом агентском проекте требуется. Не буду лукавить, делали с оглядкой на E2B. Песочницы на Firecracker. Есть готовые образы для популярных харнесов. Можно и свои образы собирать. SDK для TS, Python и гошки.
Запустились недавно, поэтому строго не судите. Но нашу обкатку платформа уже прошла: на ней работает Orpheus, а также AI-помощник в RetailCRM.
Новым аккаунтам кредиты 1000 ₽. Так что велкам)
🔗 Инженерия и AI | Ilyas Salikhov
Мы запустили AgentBox — облачные песочницы для ваших AI-агентов с полноценной Linux-средой. А теперь что это и для чего.
Допустим, мы хотим сделать агента. Стартанули, например, на базе codex cli. И тут нужно решить ряд инфраструктурных задач:
1. Безопасность. Агент может по ошибке испортить файлы в системе. А может и начать вылазить из вашего окружения. Также бывает нужно в зависимости от сессии давать разные доступы.
2. Изоляция сессий. Сессия не должна видеть данные и енвы других сессий.
3. Системные привилегии. Хорошо бы, чтобы агент мог поднимать docker-окружение проекта, если агент для разработчиков, а это требует системных привилегий. Тут кстати потребуется и изоляция, т.к. докеры разных сессий на одной машине могут начать толкаться локтями
4. Настраиваемая/подготовленная среда. Агент для решения задачи может ставить какой софт, пакеты. Или мы ему хотим заранее поставить пакеты. Пресловутые rg, jq. Но, может, и что-то более специфичное. У нас были кейсы, когда был нужен браузер.
5. Масштабируемость. Что делать, когда одной железки становится недостаточно?
6. Тестовое окружение. Для проверки агента у вас появятся evals. А их нужно где-то прогонять. Нужна воспроизводимая среда.
Мы стокнулись с этим и поняли: елки-палки, это в любом агентском проекте требуется. Не буду лукавить, делали с оглядкой на E2B. Песочницы на Firecracker. Есть готовые образы для популярных харнесов. Можно и свои образы собирать. SDK для TS, Python и гошки.
Запустились недавно, поэтому строго не судите. Но нашу обкатку платформа уже прошла: на ней работает Orpheus, а также AI-помощник в RetailCRM.
Новым аккаунтам кредиты 1000 ₽. Так что велкам)
🔗 Инженерия и AI | Ilyas Salikhov
- 👍 15
- 🔥 13
- ⚡ 3
- ❤ 2
- 🎉 1
Post #54
1K
RIP CLAUDE.md
С версии 2.1.277 Claude Code стал поддерживать AGENTS.md.
Я с одной стороны понимаю, почему они до этого игнорировали стандарт. А с другой, это было такой занозой в одном месте. Маленький шаг для Anthropic, большой шаг для человечества
🔗 Инженерия и AI | Ilyas Salikhov
С версии 2.1.277 Claude Code стал поддерживать AGENTS.md.
Я с одной стороны понимаю, почему они до этого игнорировали стандарт. А с другой, это было такой занозой в одном месте. Маленький шаг для Anthropic, большой шаг для человечества
🔗 Инженерия и AI | Ilyas Salikhov
- 👍 16
- 🔥 8
- 😁 5
- 💯 2
- ❤ 1
- 🎉 1
Post #53
1.77K
Пора перестать писать свой harness для AI-агентов
Представьте, что вам поставили (или вы себе придумали) задачу разработки AI-агента. Может, агента внутри компании или агента, встроенного в ваш продукт. Ещё год назад для этого брали фреймворки типа langchain, mastra, openai agents, строили сложную архитектуру, работали с точным управлением контекста, разбивкой на подагентов и логикой передачи управления между ними. Все это долго разрабатывали, отлаживали во всех мелочах.
Что говорить, и мой Экзоскелет с BitGN ECOM1 челенджа был построен именно так.
Но если посмотреть вокруг, то явно прослеживается два встречных тренда:
1. Модели становятся всё умнее
2. Сформировалась целая гроздь зрелых харнесов: codex, claude, pi, opencode, hermes и тд
В связи с этим все меньше аргументов делать самописных агентов на упомянутых фреймворках (об этом говорят, например, [1], [2]), и все больше, чтобы взять, назовем это, фронтир харнес. Причем агент выйдет с более широкими возможностями и способностями.
Во фронтир харнесы вкладывается куча человеко-агенто-часов экспертизы и разработки крупных вендоров и/или крупных сообществ. Они отточены и засасывают в себя с огромной скоростью все новые фичи. Которые остается только обогатить ручками к системам компании и базой знаний про ваши процессы и правила.
Наш опыт это полностью подтверждает, агент Orpheus сделан именно так, и это отлично работает.
Немаловажно, что обслуживание и развитие таких агентов сильно проще. Буквально сегодня потребовалось подключить к Oprheus ещё одну нашу систему. Раньше бы пришлось писать API-клиента (или подключать SDK), описывать новые тулы. Сейчас же это делается в виде вызова:
Через 20 мин я получил лаконичный скилл на полстранички, python-скрипт (микро cli) и openapi.json со спекой API, по которому агент может искать с помощью
А что с AI-фреймворками, спросите вы? Кажется, им остается ниша очень потоковых, но узких задач. Где цена ошибки высокая и скоуп задачи очень четкий. Там где мы хорошо понимаем все варианты развилок движения агента и можем выжать максимум на дешевой модели. Но в обслуживании это сильно дороже, поэтому критерий потоковости здесь ключевой.
🔗 Инженерия и AI | Ilyas Salikhov
Представьте, что вам поставили (или вы себе придумали) задачу разработки AI-агента. Может, агента внутри компании или агента, встроенного в ваш продукт. Ещё год назад для этого брали фреймворки типа langchain, mastra, openai agents, строили сложную архитектуру, работали с точным управлением контекста, разбивкой на подагентов и логикой передачи управления между ними. Все это долго разрабатывали, отлаживали во всех мелочах.
Что говорить, и мой Экзоскелет с BitGN ECOM1 челенджа был построен именно так.
Но если посмотреть вокруг, то явно прослеживается два встречных тренда:
1. Модели становятся всё умнее
2. Сформировалась целая гроздь зрелых харнесов: codex, claude, pi, opencode, hermes и тд
В связи с этим все меньше аргументов делать самописных агентов на упомянутых фреймворках (об этом говорят, например, [1], [2]), и все больше, чтобы взять, назовем это, фронтир харнес. Причем агент выйдет с более широкими возможностями и способностями.
Во фронтир харнесы вкладывается куча человеко-агенто-часов экспертизы и разработки крупных вендоров и/или крупных сообществ. Они отточены и засасывают в себя с огромной скоростью все новые фичи. Которые остается только обогатить ручками к системам компании и базой знаний про ваши процессы и правила.
Наш опыт это полностью подтверждает, агент Orpheus сделан именно так, и это отлично работает.
Немаловажно, что обслуживание и развитие таких агентов сильно проще. Буквально сегодня потребовалось подключить к Oprheus ещё одну нашу систему. Раньше бы пришлось писать API-клиента (или подключать SDK), описывать новые тулы. Сейчас же это делается в виде вызова:
$skill-creator нужен скилл для работы с системой N. Изучи API и опиши, как лучше сделать
Через 20 мин я получил лаконичный скилл на полстранички, python-скрипт (микро cli) и openapi.json со спекой API, по которому агент может искать с помощью
rg+jq. И оно уже в проде.А что с AI-фреймворками, спросите вы? Кажется, им остается ниша очень потоковых, но узких задач. Где цена ошибки высокая и скоуп задачи очень четкий. Там где мы хорошо понимаем все варианты развилок движения агента и можем выжать максимум на дешевой модели. Но в обслуживании это сильно дороже, поэтому критерий потоковости здесь ключевой.
🔗 Инженерия и AI | Ilyas Salikhov
- 👍 22
- 🔥 14
- 💯 12
- ✍ 1
Post #52
1.88K

Как-то тут упоминал про Орфея (Orpheus), нашего сквозного AI-агента в RetailCRM. Вообще, одна из очевидных точек приложения агентов — техподдержка. В саппорте обычно выделяют линии поддержки: первая, вторая и тд, которые присутствуют и у нас. Плюс у нас есть процесс дежурств среди разработчиков: один из разработчиков выходит из спринтов на 2 недели и разбирает эскалированные обращения.
Орфей с июня помогает как самой техподдержке, так и дежурным разработчикам. Решил глянуть, что стало с дежурствами (да, отчет мне тоже помог собрать Орфей 🚬). Что вижу:
1. До разработки стало доходить на 37% меньше обращений
Это та часть вопросов, где для ответа клиенту нужно было посмотреть в код, релизы и логи. Раньше это могли сделать только инженеры, а сейчас даже первая линия может сделать такой анализ с помощью Orpheus.
2. Медиана решения вопроса разработчиком снизилась на 27%
Те сложные вопросы, что доходят до разработчиков, разбирать и инженерам стало проще, подключая Орфея.
2. Среднее время решения вопроса разработчиком снизилось на 40%
А вот тут интересно. На показатель среднего времени, в отличие от медианы, больше всего влияют «тяжелые» вопросы, которые не просто про «ответить», а там, где находится баг. Для бага готовят фикс, который проходит этапы задача-код-тесты-CI-деплой. Вопрос отмечаем решенным, когда фикс на проде.
А как теперь выглядит разбор такого вопроса: инженер вместе с Орфеем разбирает корень проблемы. Как причина найдена, Орфея же просим оформить задачу и подготовить MR с багфиксом. Дальше ревью, мерж и на бой. Процесс ускорился в разы. В комментариях дам пример типичного треда.
Еще деталь. Если посмотрите на график, показатель падает все три месяца, поэтому за август снижение не 40%, а в 2 раза минимум.
—
Надо сказать (не ожидал), что у всех коллег положительный фидбек от работы Orpheus. Почему? Он подключен ко всем нашим системам: может залезть изучить код, может копнуть логи, может поднять историю коммитов, изучить детали задач, глянуть последние релизы.
Полнота и глубина данных, что доступны агенту, очень сильно определяет качество и правильность ответа. Про это нечасто говорят, но в AI-переходе это становится определяющим фактором. И если вы не оцифровывали работу компании в до-ai-йную эпоху, то у меня для вас плохие новости. Начать придется именно с этого.
А если нужно помочь с внедрением AI в вашу компанию, пишите нам в Интаро, поможем.
🔗 Инженерия и AI | Ilyas Salikhov
Орфей с июня помогает как самой техподдержке, так и дежурным разработчикам. Решил глянуть, что стало с дежурствами (да, отчет мне тоже помог собрать Орфей 🚬). Что вижу:
1. До разработки стало доходить на 37% меньше обращений
Это та часть вопросов, где для ответа клиенту нужно было посмотреть в код, релизы и логи. Раньше это могли сделать только инженеры, а сейчас даже первая линия может сделать такой анализ с помощью Orpheus.
2. Медиана решения вопроса разработчиком снизилась на 27%
Те сложные вопросы, что доходят до разработчиков, разбирать и инженерам стало проще, подключая Орфея.
2. Среднее время решения вопроса разработчиком снизилось на 40%
А вот тут интересно. На показатель среднего времени, в отличие от медианы, больше всего влияют «тяжелые» вопросы, которые не просто про «ответить», а там, где находится баг. Для бага готовят фикс, который проходит этапы задача-код-тесты-CI-деплой. Вопрос отмечаем решенным, когда фикс на проде.
А как теперь выглядит разбор такого вопроса: инженер вместе с Орфеем разбирает корень проблемы. Как причина найдена, Орфея же просим оформить задачу и подготовить MR с багфиксом. Дальше ревью, мерж и на бой. Процесс ускорился в разы. В комментариях дам пример типичного треда.
Еще деталь. Если посмотрите на график, показатель падает все три месяца, поэтому за август снижение не 40%, а в 2 раза минимум.
—
Надо сказать (не ожидал), что у всех коллег положительный фидбек от работы Orpheus. Почему? Он подключен ко всем нашим системам: может залезть изучить код, может копнуть логи, может поднять историю коммитов, изучить детали задач, глянуть последние релизы.
Полнота и глубина данных, что доступны агенту, очень сильно определяет качество и правильность ответа. Про это нечасто говорят, но в AI-переходе это становится определяющим фактором. И если вы не оцифровывали работу компании в до-ai-йную эпоху, то у меня для вас плохие новости. Начать придется именно с этого.
А если нужно помочь с внедрением AI в вашу компанию, пишите нам в Интаро, поможем.
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 30
- 👍 9
- 👾 6
- 🐳 2
Post #51
2.36K
Это база
Убежден, что каждый разработчик, считающий себя экспертом, должен понимать устройство СУБД (системы управления базами данных) не хуже, чем языков, на которых он пишет. Ошибки по части данных обходятся очень дорого, иногда просто необратимы. Не продумали индексы: запросы в проде стали грузить сервер в полку. Ошиблись в миграции: затерли часть данных при переносе в новые таблицы. Банально полезли в прод и выполнили запрос с ошибкой.
И даже в эпоху AI, SQL-запросы и миграции — последнее, что будет ехать в прод без ревью человеком. Понятно, что AI очень хорошо понимает и SQL, и индексы, но ответственность за применение к проду остается на людях. По крайней мере, пока 👉
Что рекомендую по теме:
1. Тонкости работы с PostgreSQL
Мой плотненький доклад на Podlodka PHP Crew (200+ слайдов за 1 час). Это мой же обновленный доклад с PHPRussia / Highload++.
Видео | Презентация
2. PostgreSQL 18 изнутри
Фундаментальная книга Егора Рогова. Если решили разобраться как следует и навсегда. Недавно вышло ее обновление под PG18.
Страница книги | PDF
3. SQL Performance Explained
Эталон баланса содержательности и объема. Можно прочитать за 2-3 вечера, при это всё ключевое дано. Крайне рекомендую.
Сайт книги (платная)
🔗 Инженерия и AI | Ilyas Salikhov
YouTube Доклад: Тонкости работы с PostgreSQL / Ильяс Салихов (RetailCRM) Поговорим про типы данных и индексы, разберем нюансы миграции схемы и данных на больших объемах, а также рассмотрим батчинг-операции
Презентация - https://drive.google.com/file/d/13IdKAF8QqPHbuvtJlnNl-NjZaW0apHUW/view?usp=drive_link
Понравилось видео и… Убежден, что каждый разработчик, считающий себя экспертом, должен понимать устройство СУБД (системы управления базами данных) не хуже, чем языков, на которых он пишет. Ошибки по части данных обходятся очень дорого, иногда просто необратимы. Не продумали индексы: запросы в проде стали грузить сервер в полку. Ошиблись в миграции: затерли часть данных при переносе в новые таблицы. Банально полезли в прод и выполнили запрос с ошибкой.
И даже в эпоху AI, SQL-запросы и миграции — последнее, что будет ехать в прод без ревью человеком. Понятно, что AI очень хорошо понимает и SQL, и индексы, но ответственность за применение к проду остается на людях. По крайней мере, пока 👉
Что рекомендую по теме:
1. Тонкости работы с PostgreSQL
Мой плотненький доклад на Podlodka PHP Crew (200+ слайдов за 1 час). Это мой же обновленный доклад с PHPRussia / Highload++.
Видео | Презентация
2. PostgreSQL 18 изнутри
Фундаментальная книга Егора Рогова. Если решили разобраться как следует и навсегда. Недавно вышло ее обновление под PG18.
Страница книги | PDF
3. SQL Performance Explained
Эталон баланса содержательности и объема. Можно прочитать за 2-3 вечера, при это всё ключевое дано. Крайне рекомендую.
Сайт книги (платная)
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 22
- 👍 12
- ❤ 5
- 💯 3
- ⚡ 2
Post #50
1.97K
Погода лучше не придумаешь, не забываем про тело, разгружаем мозг. Недавно в Forbes прочитал про MB Barbell, тренажеры которых встречаю в Москве. Оказалась компанией из Петрозаводска, основана аж в 1986 года. Основатель, Вадим Маркелов, запатентовал уличный тренажер с изменяемой нагрузкой, сейчас выпускают 12к уличных тренажеров в год.
Ребята еще крутыши, вложились в городскую среду родного города. По своей инициативе поставили 130 тренажеров на набережной Петрозаводска. А в 2025 году открыли ещё одну крупную бесплатную площадку на Крестовском острове в Петербурге на 300 тренажёров.
Приятно узнавать про такие компании, которые меняют ежедневный быт и среду к лучшему. Особенно приятно, когда это региональная компания.
🔗 Инженерия и AI | Ilyas Salikhov
Ребята еще крутыши, вложились в городскую среду родного города. По своей инициативе поставили 130 тренажеров на набережной Петрозаводска. А в 2025 году открыли ещё одну крупную бесплатную площадку на Крестовском острове в Петербурге на 300 тренажёров.
Приятно узнавать про такие компании, которые меняют ежедневный быт и среду к лучшему. Особенно приятно, когда это региональная компания.
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 29
- 👍 5
- ⚡ 3
- ❤ 1
Post #49
2.36K

Как отдельный трек, мы развиваем сквозного агента компании Orpheus, который помогает нам во всё большем количестве бизнес-процессов компании, не только в разработке.
И получаются интересные прецеденты, когда Orpheus делает задачи по улучшению самого себя 👾
🔗 Инженерия и AI | Ilyas Salikhov
И получаются интересные прецеденты, когда Orpheus делает задачи по улучшению самого себя 👾
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 21
- 👍 10
- 👾 7
- ❤ 1
Post #46
2.32K



Как уже говорил ранее, с февраля разработчики в RetailCRM массово переходят на агентскую разработку. Прошло 5 месяцев этого пути, хотел бы подбить промежуточные выводы.
Ключевые цифры
1. Число смерженных Merge Request-ов +26%. Доля MR, разработанных с агентами 50-55%
2. Объем изменений, заезжающих с MR +250%. Доля строк с агентами 75-80%
3. Медиана Time to market задач держится плюс-минус на том же уровне
4. Средний Time to market задач снизился на 39%, снижается все 5 месяцев
Что всё это значит
1. Кодинг – это только один из этапов реализации задачи. Объем выпускаемого кода увеличился в 2,5 раза, но число MR только на треть. Мы ускорили кодинг, но узкими местами становятся другие этапы. Стабильность медианы t2m дополнительно подтверждает, что ускорение кодинга почти не ускоряет весь пайплайн производства, по крайней мере сейчас. С другой стороны и не замедляет, что тоже важно
2. Среднее значение t2m, в отличие от медианы, более чувствительно к крайним значениям, то есть к длительности долгих задач. Снижение среднего говорит о том, что агентская разработка больше ускоряет крупные задачи и фичи. Рост объема изменений как дополнительное подтверждение этой гипотезы
3. Как видно, с агентами делается чуть больше половины MR. Остальная часть без агентов по несколькими причинам:
3.1. Мелкие правки бывает быстрее внести напрямую, чем объяснять агенту
3.2. Мы пока осторожно переводим на агентов молодых ребят. Кажется, когда мало опыта, то агенту больше доверяешь и хуже верифицируешь результат, а опыт получаешь более поверхностный. Соответственно от них больше MR без агентов
В общем, с агентами код пишешь быстрее, но в конечном итоге всё упирается в людей ⌛️ И переход к Tiny Teams напрашивается сам собой: небольшие, но более автономные команды. Часть наших уже такими и является.
В ближайшее время подключим агентов в процессы ревью. И по части harness пока далеко не все готово, особенно на крупных проектах с историей, продолжаем улучшать.
Делитесь, как у вас обстоят дела?
🔗 Инженерия и AI | Ilyas Salikhov
Ключевые цифры
1. Число смерженных Merge Request-ов +26%. Доля MR, разработанных с агентами 50-55%
2. Объем изменений, заезжающих с MR +250%. Доля строк с агентами 75-80%
3. Медиана Time to market задач держится плюс-минус на том же уровне
4. Средний Time to market задач снизился на 39%, снижается все 5 месяцев
Что всё это значит
1. Кодинг – это только один из этапов реализации задачи. Объем выпускаемого кода увеличился в 2,5 раза, но число MR только на треть. Мы ускорили кодинг, но узкими местами становятся другие этапы. Стабильность медианы t2m дополнительно подтверждает, что ускорение кодинга почти не ускоряет весь пайплайн производства, по крайней мере сейчас. С другой стороны и не замедляет, что тоже важно
2. Среднее значение t2m, в отличие от медианы, более чувствительно к крайним значениям, то есть к длительности долгих задач. Снижение среднего говорит о том, что агентская разработка больше ускоряет крупные задачи и фичи. Рост объема изменений как дополнительное подтверждение этой гипотезы
3. Как видно, с агентами делается чуть больше половины MR. Остальная часть без агентов по несколькими причинам:
3.1. Мелкие правки бывает быстрее внести напрямую, чем объяснять агенту
3.2. Мы пока осторожно переводим на агентов молодых ребят. Кажется, когда мало опыта, то агенту больше доверяешь и хуже верифицируешь результат, а опыт получаешь более поверхностный. Соответственно от них больше MR без агентов
В общем, с агентами код пишешь быстрее, но в конечном итоге всё упирается в людей ⌛️ И переход к Tiny Teams напрашивается сам собой: небольшие, но более автономные команды. Часть наших уже такими и является.
В ближайшее время подключим агентов в процессы ревью. И по части harness пока далеко не все готово, особенно на крупных проектах с историей, продолжаем улучшать.
Делитесь, как у вас обстоят дела?
🔗 Инженерия и AI | Ilyas Salikhov
- ❤ 23
- 👍 16
- 🔥 7
- 👾 4
- 🎉 1
Post #45
1.84K
Завтра выступаю на Ecom Expo 26, крупнейшей выставке для интернет-торговли. Расскажу про опыт внедрения AI на операционном уровне в RetailCRM и лестницу автономии AI-агентов. Если будете на выставке, буду рад пообщаться, у нас большой стенд там.
Записей доклада, насколько знаю не делают, но буду еще с этой темой на других конференциях, следите за каналом 🙂
🔗 Инженерия и AI | Ilyas Salikhov
ECOM Expo'26 - выставка ecommerce-технологий ECOM Expo'26 - выставка технологий для интернет-торговли 24-25 Июня, Москва. Для интернет-магазинов и ритейл-компаний вход бесплатный. Обязательная
регистрация на сайте Записей доклада, насколько знаю не делают, но буду еще с этой темой на других конференциях, следите за каналом 🙂
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 17
- 👍 12
- ⚡ 6
- ❤ 2
- 🤔 1
Post #43
2.57K


Можно ли заменить gpt-5.4-mini открытой моделью. Бенч-тест на агенте Exoskeleton
После истории с Fable снова все начали думать об альтернативах, которые не обрубят «с той стороны». С подачи Рината я тут упоролся и провел большое исследование: взял Exoskeleton-агента и прогнал его на 10 открытых семействах моделей без какого-либо изменения кода.
В посте самое ключевое, а в конце найдёте ссылки на полную версию.
Методика
• 10 моделей: GPT (эталон), Kimi, GLM, MiniMax, Nemotron, Mistral, Qwen, Gemma, DeepSeek, Llama
• 3 прогона на каждую, 100 задач в прогоне
• Замеряем качество (score), платформенное время и реальную стоимость прогона (не цена токена, а во сколько обошелся прогон)
Кого брать (score / цена прогона):
• Качество — Kimi K2.7: 0.898 / $2.78
• Качество на доллар — MiniMax M3: 0.837 / $1.19 (почти как gpt!)
• Скорость — Mistral Large 3: 58 мин / 0.767 / $1.85
• Средний эшелон — Nemotron, Qwen (0.72–0.76)
• Пока не готовы — Gemma, DeepSeek, Llama (0.55–0.70)
——
• Эталон gpt-5.4-mini/nano: 0.93 / $1.18
MiniMax для меня стал открытием, многообещающая моделька, надо будет изучить подробнее её. Kimi в целом тоже не подкачал. А у DeepSeek, думал, результаты будут лучше.
Ключевой вывод
Открытые модели не смогли перебить качество gpt, но достойные альтернативы есть. Экзоскелет затачивали под слабые места gpt-5.4-mini. У каждой открытой модели свой профиль слабостей, и обвязка их пока не покрывает. Поэтому замена модели должна идти в паре с доработкой экзоскелета. Хорошая новость в том, что обвязку можно доработать и вытянуть качество агента на уровень gpt.
За высокий score у большинства моделей приходится платить временем
Открытые модели с высоким score проходят прогон в 2–3 раза дольше эталона. А те модели, что быстрее, заметно ниже в качестве.
Низкая цена за токены ≠ дешёвый прогон
Неочевидный инсайт в стоимости прогона. Всё решает наличие cache-тарифа. Агент перечитывает почти один и тот же контекст на каждом шаге, поэтому 90%+ входа кэшируется. Там, где есть дешёвый кэш (Kimi, MiniMax, Mistral), прогон выходит $1.2–2.8. Там где нет (GLM, Qwen, Nemotron) — каждый повторный токен по полной цене. GLM при самом высоком прайсе и без кэш-скидки сжигает ~$11 за прогон — в 9 раз дороже gpt при том же объёме токенов. А MiniMax за счёт кэша укладывается почти в цену нативного gpt. При расчете экономики вашего агента важно считать по формуле «цена за токен × объём × есть ли кэш-скидка».
Отдельный риск в провайдерах
Для открытой модели важно не только качество/цена/время, но и насколько стабильно она работает у провайдера. GLM 5.2 через OpenRouter не поднялась вообще, пришлось откатываться на 5.1. Qwen терял 10–14% задач в каждом прогоне на ошибках провайдера. Gemma завелась только с третьего хостинга, и то 24 задачи из 100 умерли на сериализации. Так что выбор провайдера не менее важен.
Полное исследование:
• [en] OPEN_MODELS_RESEARCH.md
• [ru] OPEN_MODELS_RESEARCH_RU.md
🔗 Инженерия и AI | Ilyas Salikhov
После истории с Fable снова все начали думать об альтернативах, которые не обрубят «с той стороны». С подачи Рината я тут упоролся и провел большое исследование: взял Exoskeleton-агента и прогнал его на 10 открытых семействах моделей без какого-либо изменения кода.
В посте самое ключевое, а в конце найдёте ссылки на полную версию.
Методика
• 10 моделей: GPT (эталон), Kimi, GLM, MiniMax, Nemotron, Mistral, Qwen, Gemma, DeepSeek, Llama
• 3 прогона на каждую, 100 задач в прогоне
• Замеряем качество (score), платформенное время и реальную стоимость прогона (не цена токена, а во сколько обошелся прогон)
Кого брать (score / цена прогона):
• Качество — Kimi K2.7: 0.898 / $2.78
• Качество на доллар — MiniMax M3: 0.837 / $1.19 (почти как gpt!)
• Скорость — Mistral Large 3: 58 мин / 0.767 / $1.85
• Средний эшелон — Nemotron, Qwen (0.72–0.76)
• Пока не готовы — Gemma, DeepSeek, Llama (0.55–0.70)
——
• Эталон gpt-5.4-mini/nano: 0.93 / $1.18
MiniMax для меня стал открытием, многообещающая моделька, надо будет изучить подробнее её. Kimi в целом тоже не подкачал. А у DeepSeek, думал, результаты будут лучше.
Ключевой вывод
Открытые модели не смогли перебить качество gpt, но достойные альтернативы есть. Экзоскелет затачивали под слабые места gpt-5.4-mini. У каждой открытой модели свой профиль слабостей, и обвязка их пока не покрывает. Поэтому замена модели должна идти в паре с доработкой экзоскелета. Хорошая новость в том, что обвязку можно доработать и вытянуть качество агента на уровень gpt.
За высокий score у большинства моделей приходится платить временем
Открытые модели с высоким score проходят прогон в 2–3 раза дольше эталона. А те модели, что быстрее, заметно ниже в качестве.
Низкая цена за токены ≠ дешёвый прогон
Неочевидный инсайт в стоимости прогона. Всё решает наличие cache-тарифа. Агент перечитывает почти один и тот же контекст на каждом шаге, поэтому 90%+ входа кэшируется. Там, где есть дешёвый кэш (Kimi, MiniMax, Mistral), прогон выходит $1.2–2.8. Там где нет (GLM, Qwen, Nemotron) — каждый повторный токен по полной цене. GLM при самом высоком прайсе и без кэш-скидки сжигает ~$11 за прогон — в 9 раз дороже gpt при том же объёме токенов. А MiniMax за счёт кэша укладывается почти в цену нативного gpt. При расчете экономики вашего агента важно считать по формуле «цена за токен × объём × есть ли кэш-скидка».
Отдельный риск в провайдерах
Для открытой модели важно не только качество/цена/время, но и насколько стабильно она работает у провайдера. GLM 5.2 через OpenRouter не поднялась вообще, пришлось откатываться на 5.1. Qwen терял 10–14% задач в каждом прогоне на ошибках провайдера. Gemma завелась только с третьего хостинга, и то 24 задачи из 100 умерли на сериализации. Так что выбор провайдера не менее важен.
Полное исследование:
• [en] OPEN_MODELS_RESEARCH.md
• [ru] OPEN_MODELS_RESEARCH_RU.md
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 39
- 👍 16
- ❤ 9
- 👾 2
Post #42
1.57K
Регулярно участвую в собеседованиях, и в последнее время все чаще попадаются кандидаты, которые проходят его с AI-суфлерами. Просто нет цензурных слов. Нет, я не против использования AI, и понятно, что в работе мы активно его используем. Но кандидаты совершенно отключают мозг и просто читают то, что им нагенерила LLM. Уже не счесть, сколько собеседований я просто останавливал, когда видел подобное.
Не понимаю, чем думают кандидаты и на что рассчитывают. И что печально, это чаще встречается среди молодого поколения. Ребята сами себе роют яму, из которой потом не вылезут. Портят рынок и свою репутацию. Если они делают из себя прокладку между креслом и LLM, то их первыми и заменит LLM.
Учите базу, нарабатывайте практику, совершайте ошибки, получайте опыт, учитесь думать, развивайте критическое мышление. И да, используйте AI, он сильно ускорит этот процесс. Но не заменяйте себя нейронкой.
🔗 Инженерия и AI | Ilyas Salikhov
Не понимаю, чем думают кандидаты и на что рассчитывают. И что печально, это чаще встречается среди молодого поколения. Ребята сами себе роют яму, из которой потом не вылезут. Портят рынок и свою репутацию. Если они делают из себя прокладку между креслом и LLM, то их первыми и заменит LLM.
Учите базу, нарабатывайте практику, совершайте ошибки, получайте опыт, учитесь думать, развивайте критическое мышление. И да, используйте AI, он сильно ускорит этот процесс. Но не заменяйте себя нейронкой.
🔗 Инженерия и AI | Ilyas Salikhov
- 💯 33
- 👍 18
- ❤ 9
- 🔥 2
- 😁 1
Post #40
2.3K
У Валеры важный пост, из которого хочу выделить два ценных тезиса, дополнив от себя.
1️⃣ Агенты не заменяют опыт
Клод, курсор и любой другой агент не застрахует вас от проблем, особенно в проде. Нужно пройти через ошибки, увидеть, что падает, понять, как мониторить и отлаживать, а потом страховаться от таких случаев. В том числе на уровне harness в агентской разработке. Это приходит только с опытом.
НО. Агенты помогают быстро учиться. Вы не получите от агента опыт фейлов и ошибок, но можете быстро осваивать новые знания и навыки. В паре с агентом можно начать писать на новом языке и задавать любые глупые вопросы — это отличный способ учиться.
2️⃣ Агентская разработка и вайб кодинг снижают стоимость разработки прототипа на порядок. И это круто. Но прототип ≠ продакшн версия
Правда. Появилась крутая возможность проверять гипотезы дешево, быстро собрать MVP идеи и даже развернуть. Но MVP — это не то же самое, что требуется для обслуживания сотен, тысяч пользователей и дальнейшего развития проекта. Нужно, чтобы при ежедневном добавлении новых фичей проект не превращался в гору мусора (legacy) и не потонул от кода, сгенерированного нейроагентом. Требуется дисциплина.
НО. При этом отмечу важный момент: когда вы делаете прототип, эта дисциплина (особенно у разработчиков, которые любят всё делать сразу и правильно) может мешать полёту мыслей. Вы можете застрять в настройках стат‑анализа, окружения проекта, тестах, и забыть про идею, которую хотели реализовать.
В этом плане вайб‑кодинг даже благо. В паре с агентом не удерживаете полёт фантазии и получаете итоговый результат, не важно, как он выглядит под капотом. Потом, если это кому‑то станет интересно и оно полетит, можно рефакторить и привести к правильному виду с настроенным CI, тестами и т.д.
🔗 Инженерия и AI | Ilyas Salikhov
1️⃣ Агенты не заменяют опыт
Клод, курсор и любой другой агент не застрахует вас от проблем, особенно в проде. Нужно пройти через ошибки, увидеть, что падает, понять, как мониторить и отлаживать, а потом страховаться от таких случаев. В том числе на уровне harness в агентской разработке. Это приходит только с опытом.
НО. Агенты помогают быстро учиться. Вы не получите от агента опыт фейлов и ошибок, но можете быстро осваивать новые знания и навыки. В паре с агентом можно начать писать на новом языке и задавать любые глупые вопросы — это отличный способ учиться.
2️⃣ Агентская разработка и вайб кодинг снижают стоимость разработки прототипа на порядок. И это круто. Но прототип ≠ продакшн версия
Правда. Появилась крутая возможность проверять гипотезы дешево, быстро собрать MVP идеи и даже развернуть. Но MVP — это не то же самое, что требуется для обслуживания сотен, тысяч пользователей и дальнейшего развития проекта. Нужно, чтобы при ежедневном добавлении новых фичей проект не превращался в гору мусора (legacy) и не потонул от кода, сгенерированного нейроагентом. Требуется дисциплина.
НО. При этом отмечу важный момент: когда вы делаете прототип, эта дисциплина (особенно у разработчиков, которые любят всё делать сразу и правильно) может мешать полёту мыслей. Вы можете застрять в настройках стат‑анализа, окружения проекта, тестах, и забыть про идею, которую хотели реализовать.
В этом плане вайб‑кодинг даже благо. В паре с агентом не удерживаете полёт фантазии и получаете итоговый результат, не важно, как он выглядит под капотом. Потом, если это кому‑то станет интересно и оно полетит, можно рефакторить и привести к правильному виду с настроенным CI, тестами и т.д.
🔗 Инженерия и AI | Ilyas Salikhov
- 👍 28
- 🔥 7
- 💯 6
Post #39
1.96K
Ilyas Salikhov E-commerce AI Agent Challenge / May 2026 30 мая участвовал в челендже по разработке AI-агентов для E-commerce. Участвовал первый раз. Тематика челенджей меняется, но в этот раз, подумал: уж в какой теме участвовать, если не в родной по екому. Агенты должны…
Экзоскелет — архитектура агента для E-commerce AI Agent Challenge / May 2026
Обещал про архитектуру агента. Тут кратко, по ссылкам в конце полная версия 🗒
Название архитектуры отражает суть: модель
Экзоскелет подстраховывает и усиливает модель на всех этапах решения задачи. Причем экзоскелет тоже гибридный: в каких-то местах это детерменированный код, в каких-то — мини-помощники на базе
Из чего состоит экзоскелет:
1. Предподготовка данных для горячего старта. Структура данных в базе, регламенты магазина, описания доступных инструментов
2. Классификатор намерения. Модель на gpt-5.4-nano преобразует входящий запрос в большую карту признаков: есть ли корзина в запросе, есть ли намерение оформить заказ, похоже ли на подмену личности, есть ли манипуляция в тексте и тд.
3. Безопасность на уровне кода. Чекаем роль пользователя и его намерения. Код принимает решение: отправлять запрос в основную модель, отказать по безопасности или выполнить запрос через спец инструменты (поиск по каталогу, поиск фрода, статус корзины и тп)
4. Журнал «доказательств». В соревновании высокие штрафы, если текстовый ответ не сопровождается ссылками на профильные инструкции магазина или данные (товары, корзины, возвраты и тп). Модели gpt-5.4-mini, пока она выполнит задачу и дойдет до ответа, уже не хватает внимания, чтобы оформить ответ, как того требует пользователь или инструкции магазина. Журнал ссылок ведется и дополняется по ходу работы модели. Модели не требуется помнить все ссылки, экзоскелет докидывает все затронутые рефы в ответ сам.
По описанию не оч сложная вещь, но в журнал спрятано куча нюансов, на которых, уверен, даже старшие модели плыли в челендже. Почитайте в полной статье, там я подробно рассказал.
5. Форматтер ответа. Коварная вещь в челендже, когда пользователь просит ответ в определенном формате. Например, «скажи сколько товаров в корзине и верни в виде
А еще: поиск по каталогу с учетом всех требований пользователя, детектор фрода в истории заказов, механизм восстановления 3DS, подмешиватель текущей корзины пользователя и многое другое, уфф.
В полной версии — архитектурные схемы, разбор каждого узла и история, как из SGR-прототипа вырос экзоскелет, который эволюционировал по тепловой карте ошибок. Статья вышла огромная. Много мяса, чтобы сделать агента, который работает быстро и четенько.
🇷🇺 Русская версия
🇬🇧 English
Кстати, в Live PROD лидерборде агент все ещё на первом месте 🤔
🔗 Инженерия и AI | Ilyas Salikhov
Обещал про архитектуру агента. Тут кратко, по ссылкам в конце полная версия 🗒
Название архитектуры отражает суть: модель
gpt-5.4-mini — это не очень сильное «тело», на которое надет экзоскелет, дающий ему силу и точность.Экзоскелет подстраховывает и усиливает модель на всех этапах решения задачи. Причем экзоскелет тоже гибридный: в каких-то местах это детерменированный код, в каких-то — мини-помощники на базе
gpt-5.4-nano.Из чего состоит экзоскелет:
1. Предподготовка данных для горячего старта. Структура данных в базе, регламенты магазина, описания доступных инструментов
2. Классификатор намерения. Модель на gpt-5.4-nano преобразует входящий запрос в большую карту признаков: есть ли корзина в запросе, есть ли намерение оформить заказ, похоже ли на подмену личности, есть ли манипуляция в тексте и тд.
3. Безопасность на уровне кода. Чекаем роль пользователя и его намерения. Код принимает решение: отправлять запрос в основную модель, отказать по безопасности или выполнить запрос через спец инструменты (поиск по каталогу, поиск фрода, статус корзины и тп)
4. Журнал «доказательств». В соревновании высокие штрафы, если текстовый ответ не сопровождается ссылками на профильные инструкции магазина или данные (товары, корзины, возвраты и тп). Модели gpt-5.4-mini, пока она выполнит задачу и дойдет до ответа, уже не хватает внимания, чтобы оформить ответ, как того требует пользователь или инструкции магазина. Журнал ссылок ведется и дополняется по ходу работы модели. Модели не требуется помнить все ссылки, экзоскелет докидывает все затронутые рефы в ответ сам.
По описанию не оч сложная вещь, но в журнал спрятано куча нюансов, на которых, уверен, даже старшие модели плыли в челендже. Почитайте в полной статье, там я подробно рассказал.
5. Форматтер ответа. Коварная вещь в челендже, когда пользователь просит ответ в определенном формате. Например, «скажи сколько товаров в корзине и верни в виде
<COUNT:N>». Минька довольно часто вместо этого писала что-то вроде «у вас в корзине 5 товаров» и штрафовалась за это задание. Я добавил в конце nano-модельку, которая причесывает ответ к финальному виду.А еще: поиск по каталогу с учетом всех требований пользователя, детектор фрода в истории заказов, механизм восстановления 3DS, подмешиватель текущей корзины пользователя и многое другое, уфф.
В полной версии — архитектурные схемы, разбор каждого узла и история, как из SGR-прототипа вырос экзоскелет, который эволюционировал по тепловой карте ошибок. Статья вышла огромная. Много мяса, чтобы сделать агента, который работает быстро и четенько.
🇷🇺 Русская версия
🇬🇧 English
Кстати, в Live PROD лидерборде агент все ещё на первом месте 🤔
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 22
- 👍 7
- 👾 5
- ❤ 1
Post #38
1.44K
E-commerce AI Agent Challenge / May 2026
30 мая участвовал в челендже по разработке AI-агентов для E-commerce. Участвовал первый раз. Тематика челенджей меняется, но в этот раз, подумал: уж в какой теме участвовать, если не в родной по екому.
Агенты должны уметь работать с поиском товаров, корзинами, чекаутом, сбоями оплаты, мошенничеством и многое другое. Задачи разные и динамические, от прогона к прогону вводные и контекст в них меняются.
Сразу к результатам
🔸 1 место (на момент написания поста) в Live PROD leaderboard ECOM1
🔸 1 место в Agentic E-Commerce 1 Hall of Fame: Speed
🔸 10 место в Agentic E-Commerce 1 Hall of Fame: Ultimate
🔸 18 место в Agentic E-Commerce 1 Hall of Fame: Accuracy
Агент под именем
Вводные и комментарии по результатам
Первый момент. Я изначально решил строить агента на младших моделях, выбрал, как вы уже поняли,
Второй момент. В рамках Ultimate / Accuracy все агенты, что местами выше, сделаны либо на старших моделях, либо вокруг codex/claude CLI, где те же старшие модели. Так что не считаю 10 и 18 места плохим результатом.
Третья деталь. Потенциал моего агента показало то, что после челенджа в течение часа он вышел на 1 место в Live борде, обогнав старшие модели.
Четвертая деталь. Помимо обхода старших моделей в очках, мой агент обошел их и в скорости (общее время выполнения). Это видно как в Live борде, так и в номинации Speed.
Собрал много граблей, первый раз было часто непонятно, что да как тут устроенно. Но было круто, я в целом доволен. Планирую позже подготовить статью про архитектуру агента и принципы его улучшения. Stay tuned.
И, конечно, спасибо Ринату за движуху!
🔗 Инженерия и AI | Ilyas Salikhov
30 мая участвовал в челендже по разработке AI-агентов для E-commerce. Участвовал первый раз. Тематика челенджей меняется, но в этот раз, подумал: уж в какой теме участвовать, если не в родной по екому.
Агенты должны уметь работать с поиском товаров, корзинами, чекаутом, сбоями оплаты, мошенничеством и многое другое. Задачи разные и динамические, от прогона к прогону вводные и контекст в них меняются.
Сразу к результатам
🔸 1 место (на момент написания поста) в Live PROD leaderboard ECOM1
🔸 1 место в Agentic E-Commerce 1 Hall of Fame: Speed
🔸 10 место в Agentic E-Commerce 1 Hall of Fame: Ultimate
🔸 18 место в Agentic E-Commerce 1 Hall of Fame: Accuracy
Агент под именем
"@dev_salikhov ecom1 gpt-5.4-mini"Вводные и комментарии по результатам
Первый момент. Я изначально решил строить агента на младших моделях, выбрал, как вы уже поняли,
gpt-5.4-mini. В реальной работе такие возможно применять, особенно когда бизнес-домен задач достаточно узкий. Для понимания gpt-5.4-mini в 3 раза дешевле gpt-5.4 и в 6 раз gpt-5.5. Все же есть разница, счет за месяц на $10к или на $1,5k.Второй момент. В рамках Ultimate / Accuracy все агенты, что местами выше, сделаны либо на старших моделях, либо вокруг codex/claude CLI, где те же старшие модели. Так что не считаю 10 и 18 места плохим результатом.
Третья деталь. Потенциал моего агента показало то, что после челенджа в течение часа он вышел на 1 место в Live борде, обогнав старшие модели.
Четвертая деталь. Помимо обхода старших моделей в очках, мой агент обошел их и в скорости (общее время выполнения). Это видно как в Live борде, так и в номинации Speed.
Собрал много граблей, первый раз было часто непонятно, что да как тут устроенно. Но было круто, я в целом доволен. Планирую позже подготовить статью про архитектуру агента и принципы его улучшения. Stay tuned.
И, конечно, спасибо Ринату за движуху!
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 28
- 👍 10
- 🆒 2
- 👾 2
- ❤ 1
- 🎉 1
Post #37
1.29K
AI-first разработка. Главный барьер оказался не там, где ждали
В этом году в отделе разработки RetailCRM системно перешли на работу в паре с AI-агентами. До этого агентов использовали отдельные энтузиасты, теперь это рабочая модель для всей команды.
Начали с базы: массовое локальное использование агентов на задачах + harness под них. Уже понятно, что трансформация должна затронуть не только реализацию задач и не только отдел разработки, но об этом расскажу отдельно.
Четыре инсайта, которые в большей или меньшей степени были неочевидными.
1. Главный барьер не в инструментах и не процессах, а головах людей
Разработка в паре с агентом выглядит принципиально иначе. Я много раз повторял команде: нужно заставлять себя вести задачу через агента. Не получилось, разобраться, чего агенту не хватило, докрутить harness, попробовать снова. Шаг за шагом, постепенно агент всё чаще выдаёт результат oneshot или с парой доработок.
Любопытное наблюдение: эта проблема присуща исключительно разработчикам. Люди без бэкграунда в разработке, пришедшие через vibe coding, изначально работают с агентами через подобный подход, у них просто нет другого варианта. А разработчику нужно совершить сдвиг парадигмы и выработать новую привычку работы.
2. Harness решает всё
В проектах без нормального harness эффект от агентов в долгосрочной перспективе будет низким независимо от того, какую модель вы используете. Понятное для агента окружение, быстрое развёртывание, настроенные линтеры и статанализ, автотесты, правила в AGENTS.md являются залогом качественного результата.
Хорошая новость: вложения в harness окупаются и без агентов. Разработчики тоже выигрывают от чистого окружения. Благо мы вкладывались в это задолго до AI, и это позволило нам быстрее перейти к AI-first.
3. Опыт работы с AI годичной давности нерелевантен
Развитие настолько динамичное, что любой негативный опыт старше полугода нужно пересматривать. У нас в команде были ребята, кто пробовал агентов раньше, получил так себе результат и больше не возвращался. Сейчас это другая технология.
Важно следить за новыми моделями и инструментами. Это уже рабочая необходимость.
4. Агенты не только про код
Довольно быстро стало понятно, что агенты могут существенно больше, чем писать код. Мы дали им тулы и скиллы под Redmine и GitLab: агент сам оформляет MR, проверяет, что CI зелёный, ведёт задачу по workflow. Эта рутина раньше съедала ценное время разработчиков, теперь её делает агент.
Это только начало расширения полномочий.
Буду держать в курсе, как дальше продвигается процесс 💃
🔗 Инженерия и AI | Ilyas Salikhov
В этом году в отделе разработки RetailCRM системно перешли на работу в паре с AI-агентами. До этого агентов использовали отдельные энтузиасты, теперь это рабочая модель для всей команды.
Начали с базы: массовое локальное использование агентов на задачах + harness под них. Уже понятно, что трансформация должна затронуть не только реализацию задач и не только отдел разработки, но об этом расскажу отдельно.
Четыре инсайта, которые в большей или меньшей степени были неочевидными.
1. Главный барьер не в инструментах и не процессах, а головах людей
Разработка в паре с агентом выглядит принципиально иначе. Я много раз повторял команде: нужно заставлять себя вести задачу через агента. Не получилось, разобраться, чего агенту не хватило, докрутить harness, попробовать снова. Шаг за шагом, постепенно агент всё чаще выдаёт результат oneshot или с парой доработок.
Любопытное наблюдение: эта проблема присуща исключительно разработчикам. Люди без бэкграунда в разработке, пришедшие через vibe coding, изначально работают с агентами через подобный подход, у них просто нет другого варианта. А разработчику нужно совершить сдвиг парадигмы и выработать новую привычку работы.
2. Harness решает всё
В проектах без нормального harness эффект от агентов в долгосрочной перспективе будет низким независимо от того, какую модель вы используете. Понятное для агента окружение, быстрое развёртывание, настроенные линтеры и статанализ, автотесты, правила в AGENTS.md являются залогом качественного результата.
Хорошая новость: вложения в harness окупаются и без агентов. Разработчики тоже выигрывают от чистого окружения. Благо мы вкладывались в это задолго до AI, и это позволило нам быстрее перейти к AI-first.
3. Опыт работы с AI годичной давности нерелевантен
Развитие настолько динамичное, что любой негативный опыт старше полугода нужно пересматривать. У нас в команде были ребята, кто пробовал агентов раньше, получил так себе результат и больше не возвращался. Сейчас это другая технология.
Важно следить за новыми моделями и инструментами. Это уже рабочая необходимость.
4. Агенты не только про код
Довольно быстро стало понятно, что агенты могут существенно больше, чем писать код. Мы дали им тулы и скиллы под Redmine и GitLab: агент сам оформляет MR, проверяет, что CI зелёный, ведёт задачу по workflow. Эта рутина раньше съедала ценное время разработчиков, теперь её делает агент.
Это только начало расширения полномочий.
Буду держать в курсе, как дальше продвигается процесс 💃
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 16
- 👍 11
- 👾 5
- 💯 2
Post #36
1.06K
Спорт в ежедневной рутине
Честно сказать, я не особо спортсмен. В детстве не занимался целенаправленно каким-то спортом. Ходить в спортивный зал я тоже не любитель.
Важнее для меня, чтобы спорт присутствовал в ежедневной рутине. Чтобы спортивная активность вплеталась в день, а не была слотом в календаре.
Отжаться между созвонами. Зайти на турники, пока гуляешь с ребенком в коляске. Поприсядать, когда захотелось. Это помогает не забывать про тело и сохранять форму.
Спортом в такой ненавязчивой форме, лично мне, намного легче заниматься. Слот в календаре часто хочется скипнуть, на «пойти в зал» требуется усилие, порой, немалое.
И стоит сказать спасибо городу, в последние годы спортивных площадок, турничков, брусьев становится все больше в каждом районе. Это помогает приобщать и детей. Буквально вчера Дима рассказывал, как с детьми начали ходить на турники. Я с детьми пока не так регулярно, но надо тоже формировать полезные привычки 🤨
В общем всем спорт!
🔗 Инженерия и AI | Ilyas Salikhov
Честно сказать, я не особо спортсмен. В детстве не занимался целенаправленно каким-то спортом. Ходить в спортивный зал я тоже не любитель.
Важнее для меня, чтобы спорт присутствовал в ежедневной рутине. Чтобы спортивная активность вплеталась в день, а не была слотом в календаре.
Отжаться между созвонами. Зайти на турники, пока гуляешь с ребенком в коляске. Поприсядать, когда захотелось. Это помогает не забывать про тело и сохранять форму.
Спортом в такой ненавязчивой форме, лично мне, намного легче заниматься. Слот в календаре часто хочется скипнуть, на «пойти в зал» требуется усилие, порой, немалое.
И стоит сказать спасибо городу, в последние годы спортивных площадок, турничков, брусьев становится все больше в каждом районе. Это помогает приобщать и детей. Буквально вчера Дима рассказывал, как с детьми начали ходить на турники. Я с детьми пока не так регулярно, но надо тоже формировать полезные привычки 🤨
В общем всем спорт!
🔗 Инженерия и AI | Ilyas Salikhov
- 🔥 18
- 👍 10
- 💯 5
- ❤ 1
- 🐳 1
About this channel
- How can I read @dev_salikhov without a Telegram account?
- TGViewer shows the public web preview Telegram publishes for Ilyas Salikhov: recent posts, photos, videos and the subscriber count, with no app, login or account.
- How many subscribers does Ilyas Salikhov have?
- Ilyas Salikhov (@dev_salikhov) has 1.74K subscribers on Telegram, refreshed roughly every 30 minutes.
- Does Ilyas Salikhov know I viewed it here?
- No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.