Топовые модели ИИ провалили роль репетитора
Если не просить нейросеть об обучении, в 97% случаев она решает задачи вместо ученика. К такому выводу пришла исследовательская компания Comprendo, которая протестировала шесть топовых моделей: GPT-5.6 Terra, Claude Sonnet 5, Grok 4.5, DeepSeek V4 Pro, Kimi K3 и Qwen3.8 Max.
⬛️Исследователи создали 779 диалогов по алгебре для восьмого класса, из них 298 — без специального промпта. В 97% случаев модель сразу выдавала готовый ответ. Компания не получила ни одного примера полноценного обучения.
Специальный промпт с инструкцией «учи, а не отвечай» улучшил ситуацию с обучением, но выявил другую сложность. Модели, которые лучше всего диагностировали ошибку ученика (от 88 до 100% случаев), чаще сами дописывали за него рассуждение. А те, что реже выдавали готовый ответ, пропускали ошибки.
🔼Ни одна модель не оказалась одновременно лучшей и в диагностике ошибок, и в умении обучать без готовых ответов.
При этом цена модели не коррелировала с качеством обучения. Самая дешёвая модель ($0,002 за диалог) показала лучший результат по строгому критерию, а самая дорогая (примерно в 12 раз дороже) — средний.
™️ Эдтехно в Telegram | в MAX
Post #7489
4.26K