Очень интересный график прогресса по разным бенчмаркам, выровненный относительно человека.
Тут есть и старый добрый MNIST, который 15 лет служил верой и правдой (хотя если вы сегодня его в своей статье примените, то это будет красная тряпка для ревьюверов))), есть и ImageNet.
Понятно, что скептики тут же скажут — да модели просто все это выучили! Ну, учитывая, что мы тут занимались машинным и глубоким ОБУЧЕНИЕМ, то выучили, конечно 😂 Другое дело, что они реально научились отличать не только кошек и собак, но и, например, собак разных пород, лучше людей, распознавать речь разной дикцией лучше людей, решать математические задачи лучше людей, наконец, решать научные вопросы лучше аспирантов 😉 (см. бенчмарки выше).
В принципе мне не важно, запомнила модель знания или нет, если она их по делу применяет и не глючит в выдаче результата.
Ну и мы видим, что "срок жизни" бенчмарков сильно уменьшился. Вроде создается сложный бенчмарк, но его хватает буквально на 4 года.
Вы живете в запредельно интересное время! Мощнейший переход количества в качество в скорости ОБРАБОТКИ разнородной информации произойдет, похоже, в ближайшие 2-3 года. Т.е. если интернет был 30 лет назад революцией в скорости ПЕРЕДАЧИ информации, то DL сейчас резко ускоряет ее обработку (в широком смысле слова). Будет не скучно!
Из свежего интересного — буквально вчера OpenAI выкатила Deep Research, агента, которому можно ставить довольно высокоуровневые задачи, и который уходит "подумать" надолго, но и результат в среднем выше.
Вангую — ценным станет понимать, что выдает модель. Это реально сложно.
В общем — прокачиваться будет кому-то проще, а кому-то сложнее. Делайте свой выбор! 😉
Оба графика из International AI Safety Report (January 2025). Отчет на 298 страниц, там еще много интересных графиков 😉
#speed_of_progress
