Пять базированных вещей для тех, кто вкатывается в аналитикуЧасть 1
Недавно разбирал резюме кандидатов на вакансию и в который раз заметил одни и те же шаблоны. Открываешь резюме, и там написаны все ключевые слова, супер проекты, несколько лет опыта в виде прохождения курсов, ну и скорее всего перед собесами выучены одни и те же источники с ответами на 100 самых известных вопросов. А потом откликаются на непростые вакансии с узкой направленностью и на первых же вопросах идет столкновение с
бурмалдой реальностью.
Я решил поделиться с вами пятью вадными пунктами, без которых просто не выжить в этих датасаенсах, когда начнешь работать. Кстати, в последнее время наблюдается новый уровень этого явления, когда вообще нет желания что-то ботать, ведь AI сделает все лучше:
Зачем мне SQL/статистика/питончик - у меня есть ChatGPT, он все напишет1️⃣SQL
Я уже
писал об этом, и реально рекомендую начинать именно с
SQL. Больше половины рабочего времени уходит на подготовку, обработку данных и приведение их в нормальный вид. SELECT, WHERE, JOIN, GROUP BY
, оконные функции - это обычный базовый минимум.
И пусть ChatGPT напишет вам запрос и возможно он заработает с первого раза. Только как вы поймете, что он написал его правильно, если сами не знаете SQL? Я по долгу своей работы неоднократно видел кейсы, когда скармливаешь LLM весь контекст задачи, раздаешь тулы, доступы, апишки, и возможно даже на выходе получаю красивый запрос. Но блин есть вероятность, что он либо не отработает, либо выдаст не тот результат. Допустим из-за неправильного джойна или не выбора не той колонки из 5-ти похожих.
Ну и прикиньте, если кто-то из нас спокойно понес бы этот результат бизнесу, потому что проверить не хватило экспертизы2️⃣Статистика
Описательная
статистика, выборки, доверительные интервалы является еще одной из баз аналитика. Скорее всего на реальном проекте придется спорить с бизнесом о том, значима ли разница в метриках, и стоить ли катить серый тест. Я уверен, что аргументов у вас будет больше с развитым знанием статистики.
Проблема сейчас кстати есть и с другой стороны - теперь бизнес приходит с распечаткой из Клода и говорит: "Смотри бро, модель говорит, что разница значима, катим тест". Ну и в таких случаях точно нужно уметь объяснить, почему ллмка здесь могла ошибиться из-за отсутствия правильного контекста, и конечно предложить нормальный статистический тест.
Пока AI не сможет собирать весь контекст, он не заменит языка выводов в том смысле, в котором знаем его мы3️⃣Реальный проект
Напомню, что в последнее время
требования растут. При входе в профессию уже не хватит просто знаний Python и SQL. Нужен реальный и работающий проект, сделанный полноценно от формулировки задачи до крутых метрик и выводов. И скорее всего уже не Kaggle (только если не планируется там лутать медали). Реальный имеется в виду такой, где мы сами собирали данные, чистили пропуски, работали с дубликатами, обучали модель и тестировали гипотезы.
Хорошая новость - AI реально может ускорить рутину и написать весь этот код с чисткой данных, бейздайнами и пайплайнами, уже и предложит идеи по фичам. Плохая новость - если ты бездумно использовать ллмки как костыль с первого дня, ты возможно мы не на 100% погрузимся вглубь того, что сейчас происходит внутри проекта.
Как можно управлять процессом, которого не понимаешь? Что делать, если все поломалось и данных нет? Какой вариант правильный из трех предложенных агентом?
А что менеджеру-то отвечать, если он спросит про падение метрик?Продолжение завтра...
А пока накидайте ваших мыслей в комментарии, что же там может быть еще?#ml #career #novice #softskills #llm #agents