TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #1910 1.26K
📊 Большое сравнение нейросетей в аналитике и креативе

Мы давно используем различные нейросети «на поле боя» для решения самых разных задач, но сравнивать их приходилось между собой лишь эпизодически.

Мы решили провести большой тест популярных доступных нейросетей, чтобы ответить на вопрос, какой инструмент самый сильный в аналитических задачах, требующих креатива, поиска и сопоставления информации.

➡️ Промпт

✍🏻 Поскольку многие из наших подписчиков имеют большой опыт работы в инновационной экосистеме, мы придумали задачу повышенной сложности:

Модель должна придумать 5 стартап-идей в любой Х-Tech нише, уложиться в стартовый бюджет Х $, показать дорожную карту до «единорога» — и всё это в таблице + FAQ для инвестора.

➡️ Сравниваемые нейросети

Для сравнения мы выбрали 11 популярных нейросетей:
ChatGPT 4-о, ChatGPT 4.5, ChatGPT o3, Gemini 2.0 Flash, Gemini 2.5Flash, Gemini 2.5 Pro, Qwen 2.5 Turbo, Qwen 2.5 Max, QwQ 32B, Claude 3.7, Perplexity.

Всего было проведено 22 испытания, в рамках которых один и тот же промпт предлагался различным нейросетям, а также поочередно применялся режим «+WebSearch» и/или «+Reasoning», где это было возможно.

➡️ Методология оценки

Все ответы оценивались экспертно по 6 параметрам:

1️⃣ соблюдение всех формальных требований (таблица, столбцы, число идей и т.п.)
2️⃣ соблюдение всех смысловых ограничений (рынок, сегмент, инвестиционный бюджет, сроки);
3️⃣ реалистичность и обоснованность бизнес-логики (внятные каналы монетизации, масштабируемость, проработка рисков)
4️⃣ новизна идей и их связь с текущими/грядущими трендами
5️⃣ структурированность (логика изложения, лаконичность, отсутствие «воды»), явное отделение фактов от гипотез
6️⃣ качество подготовленных ответов на FAQ инвесторов (конкурентные преимущества, барьеры входа, финансовая модель).

🏆 Итоговый рейтинг

Восторг: ChatGPT o3 (особенно с включенным Web поиском)
Самый «плотный» и точный контент, минимум воды

Хорошо: ChatGPT 4-о, Gemini 2.5 Pro
Чётко держат рамки, но меньше оригинальности

Терпимо: ChatGPT 4.5, Gemini 2.5Flash, QwQ 32B, Perplexity (DeepResearch)
Идеи годные, но хромает структура или слабые цифры

Слабо: Qwen 2.5 Max, Claude 3.7, Perplexity (автовыбор модели)
Много общих фраз и просроченных трендов

Ужасно: Gemini 2.0 Flash, Qwen 2.5 Turbo
Ошибки в таблицах, нарушены ограничения, факты спутаны

📌 Любопытное наблюдение: «+WebSearch» улучшил только ChatGPT o3. У 4-o/4.5 и Qwen Max результаты наоборот просели — модели унесло в инфо-перегруз. Режимы Deep/Reasoning у Perplexity и Gemini добавили текста, но не качества.

➡️ Выводы

✔️Молодость ≠ слабость: o3, самая «свежая» модель линейки OpenAI, выдала лучший баланс глубины и формы.
✔️Чистый reasoning > бесконтрольный web-скрейпинг: мощность LLM раскрывается там, где она сама ранжирует источники, а не тонет в сыром поисковом шуме.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • 🔥 6
  • 👍 3
  • ❤ 2
More from @testuring
  1. Sep 30, 2026🚗 Одно слово может выключить в ИИ все тормоза Авторы DrivingBench подключили несколько ун…
  2. Sep 29, 2026🧠 ИИ всё ещё страдает "амнезией" Недавно на конференции Deep Tech Night бывший директор п…
  3. Sep 28, 2026💪 Насколько ИИ уже приблизился к способности улучшать самого себя? Группа из 33 исследова…
  4. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  5. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  6. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →