Бенчмарки могут показать, какая модель набрала больше баллов. Но когда перед вами пустая папка, нет дизайн-макета, подробного ТЗ и возможности подсказывать по ходу работы — начинается совсем другой тест.
В сегодняшнем видео мы сравнили GPT-6 Sol и Claude Opus 5.5. Одинаковые условия, чистые проекты и полная автономия.
Сначала модели должны сами придумать продукт для Paragon, а затем — собрать собственную операционную систему прямо в браузере.
В этом ролике:
🟠 Даём моделям только позиционирование Paragon — смотрим, какой продукт каждая сама придумает и насколько далеко доведёт его без дополнительных указаний
🟠 Запускаем слепой тест: до самого финала не раскрываем, где GPT-6 Sol, а где Claude Opus 5.5
🟠 Просим с нуля создать Paragon OS — без списка приложений, референсов Windows/macOS и готовой концепции интерфейса
🟠 Проверяем реальные функции: сохранение состояния, терминал, окна, автоматизацию, встроенных агентов и самостоятельное исправление ошибок
🟠 Сравниваем не только результат, но и цену автономности: время работы, количество файлов, токены, вызовы инструментов и стоимость каждого прогона
Главный вопрос: что окажется полезнее в реальной разработке — быстрый компактный результат или многочасовой автономный цикл, который сам проектирует, тестирует и исправляет систему?
Ссылка на видео:
https://youtu.be/L1mIb2NrhL4
https://youtu.be/L1mIb2NrhL4
https://youtu.be/L1mIb2NrhL4
В комментариях оставили промпты для обоих тестов, исходные материалы и ссылки на демки, чтобы эксперимент можно было повторить самостоятельно.
Подписывайтесь на наш YouTube-канал — на нём будет ещё больше практических разборов.
✊ Paragon 🧑💻 Чат 📷 YouTube
