В 2016-м и 2017-м годах я рассказывал школьникам (и взрослым, поскольку это является популяризацией по постановке задачи) про то, что такое Big Data и Machine Learning и для чего они нужны. Спасибо SMTB и ЗПШ за ваши крутые каникулярные школы.
Видеозапись 17-го можно легко найти в интернетах по ключевым словам, но рекомендую посмотреть выступление Паши Клеменкова (18-го года), кажется он смог найти настоящий ключик к интересам школьников и научил их лучше играть в PUBG с помощью Big Data ;)
В 2019-м году, благодаря предложению коллег из AMC (American Center in Moscow), я замахнулся на рассказ про теорию информации. В качестве затравки взял задачу из своего опыта работы в поисковике:
- многие современные специалисты по Data Science умеют строить классификаторы профиля (пол, возраст, интересы) человека только на основе его истории посещения интернет-страниц;
- но только немногие могут на основе данных оценить какого максимального качества (точность-покрытие) можно добиться. То есть - если вам начальник сказал, что нужно построить классификатор по полу с качеством 90%, то какой размер аудитории вашего сервиса (поисковик, блог, сайт продажи товаров через интернет, …) вы можете разметить с заданным качеством (50% аудитории? 75%? Все остальные попадут в серую зону классификатора, где мальчики от девочек с точки зрения компьютера плохо различаются). И если вы можете доказать, что максимальное покрытие 50%, то не нужно будет тратить месяцы и годы экспериментов, чтобы построить вечный двигатель, который не может существовать.
Для ответа на такие вопросы и понадобится информативность по Шеннону и умение решать оптимизационные задачи. Я показал как перейти от формулы Хартли к формуле Шеннона, откуда они берутся, что позволяют подсчитать и какие задачи позволяют решать. Подсветил зачем нужно знать комбинаторику и теорию вероятности. И как это знание применить вышестоящей задаче.
От 19-го года кажется остались только фотографии (пару фото прикладываю).
На дворе 2022-й и нужен новый вызов. Я подумал о том, чтобы попробовать уйти глубже: “вкусно” и понятно рассказать про нудные фундаментальные предметы университета. Начну с теории вероятностей (тервер) и математической статистики. Конечно же эта инициатива пришла от коллег, которые обучают и лелеют школьников (еще раз спасибо всей команде @ЗПШ). Как только материал будет готов и я сдам экзамен по терверу и статистике какому-нибудь знакомому доктору физ.-мат. наук (я приятно удивился, что в моем окружении ±моего возраста их уже много, т.е. больше двух ;)), сразу пойду радовать школьников выверенным материалом.
На вспомнить тервер у меня ушло 45 часов, на статистику - 75 (давненько я не брал в руки эти учебники). Потом обязательно поделюсь полезной литературой для самостоятельного погружения для взрослых. Полагаю, что в текущих реалиях мероприятие будет проводиться онлайн.
Дату мероприятия пока не анонсирую. Тогда к чему я все это? А вот к чему:
1. Делиться знаниями и опытом - это мега круто;
2. Если вы хотите поддержать такого рода проекты, то это можно сделать:
а) финансово
б) своим личным временем (от формата провести мини-курс, до формата - поучаствовать волонтером)
ЗПШ: FB + VK
ШМТБ: FB fundraising + VK
Если стесняетесь / не найдете куда писать, как писать или помочь, то пишите мне или на study@bigdatateam.org, перенаправим релевантным людям.
А кто просто хочет послушать давно забытое старое (или новое) в научно-популярном стиле - ставьте лайки и пишите комментарии ;)
Post #86
263