16 апреля закончился приём заявок на хакатон от DeepMind и Kaggle. Призовой фонд — $200,000. Задача непривычная: не «обгони модель», а придумать, как её вообще правильно измерять.
DeepMind опубликовали научную работу с таксономией из 10 когнитивных способностей, по которым стоит оценивать прогресс к AGI. Список взят из психологии, а не из бенчмарков с LeetCode:
восприятие · генерация · память · рассуждение · решение задач · обучение · метапознание · внимание · исполнительные функции · социальное познание
Дальше — самое интересное. По пяти из этих способностей хороших тестов просто нет: обучение, метапознание, внимание, исполнительные функции, социальное познание. Именно под них DeepMind и запустили хакатон — чтобы сообщество придумало бенчмарки, которых индустрии не хватает.
Как оценивают. Вместо «реши задачу» — сравнение с человеком. Даёшь модели задание, даёшь его же человеку, смотришь разницу. Близко к человеческому baseline → способность развита. Проваливается → ещё нет.
Зачем это нужно. Такие оценки
Post #320
609

- ❤ 2
- 👍 1