Мы привыкли оценивать LLM по сухим бенчмаркам вроде MMLU или смотреть рейтинг LLMArena. Но при использовании LLM мы не оставляем ИИ наедине с задачей, а работаем с ним в диалоге. Новое исследование «Quantifying Human-AI Synergy» показало:
умение решать задачи в одиночку и умение решать их с ИИ — это два разных навыка.
Работа предлагает новый фреймворк для оценки того, как реально повышается продуктивность человека в паре с нейросетью. Исследование проведено учеными из Northeastern University и University College London — ведущих мировых центров в области сетевых наук и социального взаимодействия.
📌 Методология исследования
667 участников решали задачи по математике, физике и этическому рассуждению. Сравнивали работу людей с GPT-4o и Llama-3.1-8B. Метод — Байесовская теория тестирования. Это позволило математически отделить сложность задачи от способностей человека, и, что самое важное, разделить «индивидуальную способность» решать самому и «коллаборативную способность» решать с ИИ.
💡Инсайты
1️⃣ Парадокс «Слабого напарника»
В одиночном режиме модель Llama-3.1-8B решает задачи хуже, чем средний человек. Логично было бы предположить, что «глупый» помощник будет только мешать. Но в паре с человеком даже эта слабая модель дает существенный прирост эффективности, позволяя команде работать лучше, чем человек в одиночку. Поэтому ИИ не обязательно должен быть умнее вас, чтобы быть полезным.
2️⃣ ИИ как «Великий Уравнитель»
Пользователи с низкими индивидуальными способностями получают максимальный прирост от использования ИИ. Это подтверждает гипотезу, что ИИ выравнивает игровое поле, подтягивая слабых. Однако пользователи с высокими способностями все равно остаются лидерами по абсолютному результату в паре с ИИ. ИИ помогает им меньше в процентном соотношении, но их итоговый продукт всё равно качественнее.
3️⃣ Это не про «старание», а про «понимание»
Исследователи ввели метрики «усилий»: количество реплик в диалоге, количество напечатанных символов, частота правок. Даже если вычесть фактор усилий, Theory of Mind (ToM - способность человека представлять и рассуждать о ментальных состояниях другого агента) все равно остается значимым предиктором качества. То есть, длинные и подробные промпты работают хуже, чем промпты, написанные с пониманием «психологии» модели. Поэтому не нужно писать больше, нужно писать тоньше, учитывая «ментальное состояние» модели.
4️⃣ Theory of Mind — это динамическое состояние, а не черта характера
Исследование показало, что уровень проявления ToM варьируется от задачи к задаче у одного и того же человека. Это значит, что способность эффективно работать с ИИ — это не фиксированный талант, с которым рождаются. Это когнитивное состояние, которое можно «включать» или тренировать. Когнитивная нагрузка может мешать этому процессу, а правильный настрой — помогать.
Рекомендация — развивайте навык промптинга через призму Theory of Mind. Думайте о том, что модель «знает», а чего нет, адаптируйте запросы динамически, как в разговоре с живым ассистентом. Ваше умение «почувствовать» модель напрямую влияет на качество её ответов.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
