📊 Большое сравнение нейросетей в аналитике и креативе
Мы давно используем различные нейросети «на поле боя» для решения самых разных задач, но сравнивать их приходилось между собой лишь эпизодически.
Мы решили провести большой тест популярных доступных нейросетей, чтобы ответить на вопрос, какой инструмент самый сильный в аналитических задачах, требующих креатива, поиска и сопоставления информации.
➡️ Промпт
✍🏻 Поскольку многие из наших подписчиков имеют большой опыт работы в инновационной экосистеме, мы придумали задачу повышенной сложности:
Модель должна придумать 5 стартап-идей в любой Х-Tech нише, уложиться в стартовый бюджет Х $, показать дорожную карту до «единорога» — и всё это в таблице + FAQ для инвестора.
➡️ Сравниваемые нейросети
Для сравнения мы выбрали 11 популярных нейросетей:
ChatGPT 4-о, ChatGPT 4.5, ChatGPT o3, Gemini 2.0 Flash, Gemini 2.5Flash, Gemini 2.5 Pro, Qwen 2.5 Turbo, Qwen 2.5 Max, QwQ 32B, Claude 3.7, Perplexity.
Всего было проведено 22 испытания, в рамках которых один и тот же промпт предлагался различным нейросетям, а также поочередно применялся режим «+WebSearch» и/или «+Reasoning», где это было возможно.
➡️ Методология оценки
Все ответы оценивались экспертно по 6 параметрам:
1️⃣ соблюдение всех формальных требований (таблица, столбцы, число идей и т.п.)
2️⃣ соблюдение всех смысловых ограничений (рынок, сегмент, инвестиционный бюджет, сроки);
3️⃣ реалистичность и обоснованность бизнес-логики (внятные каналы монетизации, масштабируемость, проработка рисков)
4️⃣ новизна идей и их связь с текущими/грядущими трендами
5️⃣ структурированность (логика изложения, лаконичность, отсутствие «воды»), явное отделение фактов от гипотез
6️⃣ качество подготовленных ответов на FAQ инвесторов (конкурентные преимущества, барьеры входа, финансовая модель).
🏆 Итоговый рейтинг
Восторг: ChatGPT o3 (особенно с включенным Web поиском)
Самый «плотный» и точный контент, минимум воды
Хорошо: ChatGPT 4-о, Gemini 2.5 Pro
Чётко держат рамки, но меньше оригинальности
Терпимо: ChatGPT 4.5, Gemini 2.5Flash, QwQ 32B, Perplexity (DeepResearch)
Идеи годные, но хромает структура или слабые цифры
Слабо: Qwen 2.5 Max, Claude 3.7, Perplexity (автовыбор модели)
Много общих фраз и просроченных трендов
Ужасно: Gemini 2.0 Flash, Qwen 2.5 Turbo
Ошибки в таблицах, нарушены ограничения, факты спутаны
📌 Любопытное наблюдение: «+WebSearch» улучшил только ChatGPT o3. У 4-o/4.5 и Qwen Max результаты наоборот просели — модели унесло в инфо-перегруз. Режимы Deep/Reasoning у Perplexity и Gemini добавили текста, но не качества.
➡️ Выводы
✔️Молодость ≠ слабость: o3, самая «свежая» модель линейки OpenAI, выдала лучший баланс глубины и формы.
✔️Чистый reasoning > бесконтрольный web-скрейпинг: мощность LLM раскрывается там, где она сама ранжирует источники, а не тонет в сыром поисковом шуме.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Post #1910
1.26K

- 🔥 6
- 👍 3
- ❤ 2