TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2113 600
🤝 Человек + ИИ: новое исследование показывает, что синергия важнее мощности модели

Мы привыкли оценивать LLM по сухим бенчмаркам вроде MMLU или смотреть рейтинг LLMArena. Но при использовании LLM мы не оставляем ИИ наедине с задачей, а работаем с ним в диалоге. Новое исследование «Quantifying Human-AI Synergy» показало:

умение решать задачи в одиночку и умение решать их с ИИ — это два разных навыка.


Работа предлагает новый фреймворк для оценки того, как реально повышается продуктивность человека в паре с нейросетью. Исследование проведено учеными из Northeastern University и University College London — ведущих мировых центров в области сетевых наук и социального взаимодействия.

📌 Методология исследования

667 участников решали задачи по математике, физике и этическому рассуждению. Сравнивали работу людей с GPT-4o и Llama-3.1-8B. Метод — Байесовская теория тестирования. Это позволило математически отделить сложность задачи от способностей человека, и, что самое важное, разделить «индивидуальную способность» решать самому и «коллаборативную способность» решать с ИИ.

💡Инсайты

1️⃣ Парадокс «Слабого напарника»
В одиночном режиме модель Llama-3.1-8B решает задачи хуже, чем средний человек. Логично было бы предположить, что «глупый» помощник будет только мешать. Но в паре с человеком даже эта слабая модель дает существенный прирост эффективности, позволяя команде работать лучше, чем человек в одиночку. Поэтому ИИ не обязательно должен быть умнее вас, чтобы быть полезным.

2️⃣ ИИ как «Великий Уравнитель»
Пользователи с низкими индивидуальными способностями получают максимальный прирост от использования ИИ. Это подтверждает гипотезу, что ИИ выравнивает игровое поле, подтягивая слабых. Однако пользователи с высокими способностями все равно остаются лидерами по абсолютному результату в паре с ИИ. ИИ помогает им меньше в процентном соотношении, но их итоговый продукт всё равно качественнее.

3️⃣ Это не про «старание», а про «понимание»
Исследователи ввели метрики «усилий»: количество реплик в диалоге, количество напечатанных символов, частота правок. Даже если вычесть фактор усилий, Theory of Mind (ToM - способность человека представлять и рассуждать о ментальных состояниях другого агента) все равно остается значимым предиктором качества. То есть, длинные и подробные промпты работают хуже, чем промпты, написанные с пониманием «психологии» модели. Поэтому не нужно писать больше, нужно писать тоньше, учитывая «ментальное состояние» модели.

4️⃣ Theory of Mind — это динамическое состояние, а не черта характера
Исследование показало, что уровень проявления ToM варьируется от задачи к задаче у одного и того же человека. Это значит, что способность эффективно работать с ИИ — это не фиксированный талант, с которым рождаются. Это когнитивное состояние, которое можно «включать» или тренировать. Когнитивная нагрузка может мешать этому процессу, а правильный настрой — помогать.

Рекомендация — развивайте навык промптинга через призму Theory of Mind. Думайте о том, что модель «знает», а чего нет, адаптируйте запросы динамически, как в разговоре с живым ассистентом. Ваше умение «почувствовать» модель напрямую влияет на качество её ответов.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 5
  • 👍 4
More from @testuring
  1. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  2. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  3. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  4. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  5. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  6. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →