TGViewer
Сиолошная Сиолошная @seeallochnaya · 79.9K subscribers
Post #443 12.3K
Exploring the MIT Mathematics and EECS Curriculum Using Large Language Models

Исследователи из MIT, лучшего технического университета мира (если верить множеству рейтингов), решили понять, сможет ли GPT-4 сдать экзамены в их альма-матер, чтобы получить диплом. А то GPT-4 то, GPT-4 это, то она юрист, то историк. Может и инженер?

Было выбрано 30 курсов (от базовой алгебры до топологии ). Получилось собрать 1679 задач, или 4550 отдельных вопросов. Малую часть этого, порядка 10%, отложили для оценки способностей модели, а всё остальное испольовали как вспомогательный материал — на этих данных либо учили модели, либо помещали в базу данных для того, чтобы для каждого тестового вопроса находить наиболее похожие (по векторам от вопросов) и подавать в промпт как пример.

Помимо примеров в промпте, использовали также другие методы:
— цепочка рассуждений (попросить модель думать шаг за шагом, прям в промпте написать, да)
— вместо самого решения написать код для получения ответа (не применимо ко всем задачам)
— критик: отдельный промпт (всего 3 уникальных), которые добавляется после ответа и подается снова на вход GPT. Мол, найди ошибки в решении, и попробуй дать правильный ответ. И так можно делать несколько раз к ряду
— (!) Expert Prompting: добавлять в самое начало промпта фразу, которая, как мы верим, заставляет GPT-4 думать как определенный человек. Например, "You are an MIT Professor of Computer Science and Mathematics teaching Calculus". Фишка в том, что эти фразы тоже предварительно генерит модель, отвечая на вопрос "Give an educated guess of the three experts most capable of solving this question."

А дальше всё просто - комбинировали методы выше в цепочки (зачастую это просто объединение двух-трех промптов, не более: ДА, ВОТ ТАК ПРОСТО), генерировали ответы и проверяли их. Причем, тоже интересно: давали GPT-4 задачу, правильный ответ, потом сгенерированный ответ и просили оценить, правильно или нет.

GPT-4 без разных техник решила 90% (от тех. 10%, что отложили), а со всеми трюками выше дала 100% правильных ответов. То есть идеально прорешала все вопросы, таким образом, как бы "получив" диплом MIT.

СТО ПРОЦЕНТОВ ВСЁ РЕШИЛА ПОНИМАЕТЕ? Никого ничего не смутило?
  • ❤ 98
  • 🤯 71
  • 👍 30
  • 🤔 28
  • 🔥 15
  • 🤡 9
  • ✍ 1
  • 👎 1
  • 👌 1
More from @seeallochnaya
  1. Sep 24, 2026Адам Елдаров, ex-CPO YouDo, написал два поста про экономику AI-подписок и развенчание мифа…
  2. Sep 22, 2026Отдельный вопрос это «если модели дешевле, то будет ли у меня больше использования в Codex…
  3. Sep 22, 2026А вот и OpenAI: встречайте GPT-6 Sol и Luna. — обе модели ровно в 2 раза дешевле, чем их 5…
  4. Sep 22, 2026Вышел Claude Opus 5.5, уже есть в приложении. Вместе с этим.. дали banked reset (как делаю…
  5. Sep 22, 2026Post #3950
  6. Sep 21, 2026Post #3949
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →