🤔 Не моделью единой
Не знаем, как вы, но мы считаем, что сейчас забавный этап ИИ-рынка, этап взросления. Сначала все спорили, какая модель умнее — теперь всё чаще вопрос в том, умеет ли ваш GPT-6 Astra что-то ещё помимо "вопрос-ответ".
Всё просто: положить Claude, GPT или Gemini в интерфейс и надеяться на великую машину — ещё не значит получить хороший ИИ-продукт.
Одну и ту же модель можно заставить вручную кормить контекстом и промптами. А можно дать ей репозиторий, терминал, браузер, специализированные скиллы, память о ходе работы, суб-агентов и нормальную оркестрацию. Формально двигатель тот же, а на практике — совсем другой уровень задач.
Именно поэтому нам всё меньше нравится сравнение ИИ-продуктов по принципу: "какие модели у вас под капотом?". Это примерно как сравнивать IDE по числу доступных плагинов.
Разумеется, модели важны. Но поверх них есть ещё harness: инструменты, контекст, скиллы, управление агентами, механика длинных задач и десяток менее заметных решений, которые либо помогают модели реализовать свои способности, либо успешно мешают ей это сделать...
И да, тут будет блок снова про бенчмарк для нашего харнесса. Мы прогнали Kodik IDE на глобальных бенчмарках, один на один с другими агентскими инструментами. Из звёздных и популярных — Cursor, ChatGPT Codex, Claude Code.
Скоро покажем методологию и результаты. Признаемся, удивили они даже нас. ❤️
Post #103
283

- ❤ 17
- 👍 5
- 🕊 5
- 🔥 3
- 🐳 1