А еще статья настолько не понравилась другим андерградам MIT, что они выпустили отдельный подробный разбор датасета:
https://flower-nutria-41d.notion.site/No-GPT4-can-t-ace-MIT-b27e6796ab5a48368127a98216c76864
Что они там нашли:
- Нерешаемые задания, для ответа на которые нужно было увидеть картинки / графики / предшествующую задачу, которые не были доступны GPT-4
- Повторения заданий, при чем есть полные повторения вопросов, так и просто очень похожие формулировки. Напомню, что авторы вставляли 3 похожих вопроса и ответы на них в промт модели, по сути обеспечивая data leak
- Просто коряво сделенные промты, где место вопроса занимал system prompt и наоборот
Post #960
2.68K
я обучала одну модель И дальше про LLMs evaluating LLMs: на днях вышел пейпер, где авторы собрали 4550 заданий из 30 курсов Mathematics and Electrical Engineering and Computer Science (EECS) в MIT. Эти 30 курсов достаточно сдать, чтобы выпуститься, собственно, бакалавром И вот…

- 🔥 17
- 🤬 3
- 😁 1