TGViewer
Channel Public Channel
Задачи DS - Собеседования, Соревнования, ШАД

Задачи DS - Собеседования, Соревнования, ШАД

@zadachi_ds

Чат: @zadachi_ds_chat
По всем вопросам: @vice22821
Subscribers
8.25K
Photos
63
Videos
2
Links
117
Recent Posts 18 shown
Post #436 2.46K
Полный цикл собесов в Яндекс (МЛ 2026)

Сейчас студенты наших курсов под чутким сопровождением проходят отборы в Яндекс, поэтому продолжаю радовать вас инсайдами и актуальными вопросами. Далее представлен слегка отредактированный текст нашего студента.

Я, как и все мои сокурсники по МИРЭА, пробовал пройти на стажировку в Яндекс. Получилось с третьей попытки, расскажу обо всём по порядку.

Вступительный контест
Задания взял отсюда, просто прорешал заранее и сдал, но зашли только 3 задачи. Кстати разбор стажировки Яндекс и Яндекс Intern Week Offer по МЛ уже выложен на наших курсах МЛ ПРО, ИИ агенты ПРО.
➡️ Записаться

Секция ML & Programming
Так теперь называется МЛ секция. У Яндекса есть видео, как она проходит, у меня было очень похоже. Сначала задача на код: найти в массиве два числа с заданной суммой. Я быстро написал решение через словарь и думал, что на этом всё, но потом ещё минут пятнадцать разбирали частные случаи: пустой массив, одинаковые числа, можно ли взять один элемент дважды. Потом попросили самому придумать тесты. Дальше теория: как обучается градиентный бустинг, чем он отличается от случайного леса, что будет, если деревьев сделать намного больше. И метрики: что показывает ROC-AUC и на что смотреть, когда положительных примеров один на тысячу. На PR-AUC я запутался, но с подсказкой ответил.

Алгоритмическая секция
Две задачи в онлайн-редакторе. Код не запускается, проверяешь его глазами, и обязательно спрашивают сложность. Первая задача: в массиве положительных чисел найти самый короткий подотрезок, сумма которого не меньше заданной. Сначала написал перебор за квадрат, потом с подсказкой переделал на два указателя. Вторая про бинарное дерево: вывести вершины, которые видно, если смотреть на дерево справа. Обе известные, средний уровень с LeetCode. В конце немного поспрашивали про Питон и базы данных, с которыми я работал.

Дальше были собеседования с командами, у меня три.

Собес 1 (Яндекс Лавка)
Самый спокойный из трёх. Спрашивали про опыт и пет-проекты. Я рассказал про кредитный скоринг и рекомендации фильмов, которые взял готовыми и переделал под себя. Ребята рассказали, что часть работы со спросом и остатками у них уже делают агенты на LLM, а стажёру предстоит собирать примеры, где агент ошибся, и проверять, что после правок он не стал хуже. Спросили, как бы я оценивал такого агента. Я предложил, чтобы ответы проверяла другая модель. Спросили про минусы, и я не знал, что такая модель обычно завышает оценки длинным ответам.

Собес 2 (Яндекс Маркет)
Тут было сложнее. Дали кейс: человек первый раз открыл Маркет, истории покупок нет, что ему показывать. Обсудили холодный старт и многоруких бандитов, про это хорошо написано здесь. Потом говорили, как понять, что подборка хорошая, и почему одних кликов мало. Попросили своими словами объяснить NDCG. Дальше были A/B тесты: ошибки первого и второго рода, мощность, сколько дней держать тест. В конце простой SQL запрос: по таблице заказов вывести пользователей, у которых больше трёх заказов за месяц.

Собес 3 (Алиса)
Почти всё время говорили про языковые модели. Как понять, что новая версия модели отвечает лучше старой, если размечать ответы некому. Что будет, если в документ, который читает модель, кто-то спрятал инструкцию для неё (это называется prompt injection). Как посчитать, сколько стоит один ответ модели.

В итоге позвали две команды из трёх, я выбрал Маркет.

Подписаться: @zadachi_ds
  • 👍 9
  • ❤ 5
  • 🔥 1
Post #435 1.34K
Протестируй своё решение на задаче и данных от ПАО «Интер РАО»

На хакатоне ты создашь умного ИИ-ассистента для энергетики — регистрация уже на исходе. Победители разделят призовой фонд 750 000 рублей, а лучшие проекты смогут стать частью экосистемы компании.

Регистрация открыта до 27 сентября

Как все пройдёт:
🔹 Предложи свою концепцию на отборочном этапе.
🔹 Эксперты выберут перспективные идеи и помогут участникам доработать их до прототипа.
🔹 На финале в Москве — защита самых сильных решений.

Ты можешь участвовать один или в составе команды до 5 человек. Выбери задачу и придумай своего ИИ-ассистента:
1️⃣ Архитектор BPMN-диаграмм.
→ Создай генератор BPMN-диаграмм, который позволит из текстового описания процесса собрать валидную схему в формате BPMN 2.0.

2️⃣ Ассистент для создания ИТ/ИБ-дайджестов.
→ Напиши ассистента, который будет регулярно анализировать релевантные новости из различных источников и формировать краткую сводку.

3️⃣ Помощник для анализа документов из судов.
→ Разработай систему, которая сможет распознавать, классифицировать и заносить судебные и исполнительные документы в базу данных.

4️⃣ ИИ-помощник для подготовки презентаций.
→ Создай инструмент генерации презентации в корпоративном стиле из текстового брифа.


Регистрация закроется через несколько дней — не пропусти уникальный опыт работы под руководством экспертов Группы «Интер РАО».

Присоединяйся к хакатону: https://cnrlink.com/interraohack26zadachi
  • 👍 1
Post #434 1.78K
❗️ Яндекс открыл Intern Week Offer на стажировку, где всего за неделю ты можешь получить оффер, а не растягивать процесс на месяца.

Залетаем с ноги в Яндекс: регистрация проходит до октября, а задания уже лежат тут.

А чтобы ты точно получил оффер, мы уже сделали разбор контеста и технических этапов, они доступны нашим студентам на наших курсах:

➡️ алгоритмы про ➡️ фронтенд и бэкенд
➡️ бэкенд разработка про➡️ бэкенд
➡️ машинное обучение про ➡️ МЛ
➡️ ИИ-агенты ПРО ➡️ МЛ

Помимо разборов, которые проходят все скрытые тесты на наличие ИИ в решениях, на наших курсах вы получаете:
🔽 Доступ к закрытой базе собесов и тестовых заданий
🔽 Разбор стажировки ДС Авито (на МЛ ПРО и ИИ агенты ПРО)
🔽 Курс по выходу на доход в валюте
🔽 Гарантия оффера
🔽 Рефералка в бигтех после защиты пет-проекта
🔽 mock-собеседования с обратной связью


Успей написать администратору и не откладывай: задания могут скоро поменять!
  • 👨‍💻 2
  • ❤ 1
  • 🔥 1
Post #433 1.74K
Почему ты должен попасть на DS-буткемп Авито прямо сейчас

Дедлайн по заявкам до 20 сентября. Поэтому в посте бодро расскажем о буткемпе и работе в DS-направлении Авито. Кстати, разбор теста и остальных этапов выложен на наших курсах МЛ ПРО, ИИ агенты ПРО.
➡️ Записаться

Самый быстрый рост на рынке
Буткемп предлагает возможность вырасти от стажёра до мидла за один год. Здесь важно напомнить, что мидлы в Авито, во-первых, действительно разбирается в своей сфере, а во-вторых, получает 300к+ после вычета.
Думаю, вы понимаете, что выйти на такой уровень зарплаты за год, одновременно получая опыт работы в бигтехе и решая интересные задачи с реальным влиянием на бизнес, очень привлекательно для начинающего специалиста. От такой возможно просто глупо отказываться в начале карьеры.

Рост очень прозрачный и понятный, так как расти вы будете по матрице компетенций, параллельно работая со своим наставником. Благодаря этому вы в любой момент сможете понять, каких знаний и навыков вам не хватает. Сюда же плюсуется обучение во внутренней АА и доступ к записям внешней АА. Всё это поможет быстро прокачать знания до необходимого уровня. Если хорошо потрудиться, к концу буткемпа вполне реально выйти на уровень мидла.

Выделим отдельно несколько моментов, которые стоит знать о буткемпе:
-Очевидно, что к концу буткемпа для вас может не найтись подходящей ставки, даже если вас грейднут на мидла. В таком случае по классической схеме придётся ждать, пока в одной из команд откроется подходящая позиция.
-Во время буткемпа вы считаетесь стажёром, хотя уже через полгода зарплата будет на уровне джуна. Это значит, что вы не являетесь
штатным сотрудником. У вас не будет ДМС, компенсации командировочных расходов и некоторых других плюшек.
- Никаких подводных камней при этом нет, вам будут стабильно платить ЗП и работать с вами как с полноценным сотрудником. Требования к буткемперам разные, но зачастую они все же высокие, поэтому придется поработать.

DS в Авито
Дата-сайентисты, наравне с аналитиками, играют в Авито важную роль, а культура работы с данными здесь, пожалуй, одна из лучших на рынке. ДСер в Авито, по сути, является инженером и владельцем ML-решения полного цикла. Вы будете работать как с аналитиками, так и с проджектами и продактами. Соответственно, у вас будет возможность продвигать свои решения и показывать их влияние на бизнес, благодаря чему можно расти с невероятной скоростью.

С инфрой у Авито всё хорошо, двхшники и разрабы своё дело знают. Также есть собственные ML- и LLM-платформы, которые позволяют сосредоточиться на бизнес-задачах и метриках моделей, а не на тупой рутине.

Обычно работа состоит из четырёх частей: продуктовой постановки, исследования данных и моделей, инженерной реализации, а также проверки эффкта и дальнейшей эксплуатации решения.

По мере роста вы будете получать не просто задачи на реализацию более сложных моделей, а всё более неопределённые задачи. Вам предстоит самостоятельно формулировать подход и метрики, вести проекты, договариваться с соседними командами и отвечать за итоговый продуктовый результат. Поверьте, такой опыт крайне полезен для роста.

Перспективы после буткемпа
Самый частый сценарий после буткемпа выглядит так: ожидание своей мидловой ставки, которое обычно занимает от одного до трёх месяцев, а затем уверенное закрепление в штате.
По статистике буткемперы показывают себя в компании очень хорошо, что, конечно, заставляет задуматься о смысле существования обычного трека, ведь рост от джуна до мидла в Авито может занять до двух лет. Напомним: на буткемпе вы проходите путь от нуля до мидла за один год.

Если не сидится на месте и хочется получить грейд повыше, можно пойти пособеседоваться в другие компании на позиции уровня middle+ или senior. Особенно хорошо это может сработать с one-day-офферами и другими фаст-треками.После буткемпа вы вполне можете позиционировать себя как специалиста, который самостоятельно ведёт проекты и доводит ML-решения до реального бизнес-эффекта. Поэтому собеседования на более высокие грейды в любом случае будут полезны хотя бы для оценки собственного прогресса.

В общем, настоятельно рекомендуем запрыгнуть в этот, возможно, уходящий поезд DS-буткемпа в его нынешнем виде. Это шанс получить один из самых быстрых вариантов роста на рынке и не начинать карьеру с зарплаты в 30 тысяч тугриков.

Подписаться: @postypashki_old
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #432 1.97K
Вопросы с собеса Авито Буткемп ДС

Дедлайн подачи 20 сентября, торопитесь! Разбор же теста уже выложен только на наших курсах МЛ ПРО, ИИ агенты ПРО.
➡️ Записаться

Общие вопросы по опыту

1. Расскажи, чем ты занимаешься? Какие сферы тебе особенно удаются?
2. Можешь подробнее рассказать про задачи, которые ты выполнял?
3. В чат-боте: какая сектора использовалась, какая моделька, и какие этапы обработки запросов?
4. А моделька какая? Почему выбрали вихрь, а не Qwen?
5. Чем вы разворачивали модель? Использовали OEM или что-то другое?
6. У тебя агентная система или просто одна LLM?
7. Как вы учитывали контекст диалога пользователя с LLM?

Архитектура и компоненты RAG-системы
1. Какой эмбеддер вы использовали?
2. Как организован ваш retrieval (BM25, FAISS и т.п.)?
3. Что использовали в качестве реранкера? Дообучали ли вы его?
4. Какие лоссы применялись при обучении эмбеддера и реранкера?
5. Какие метрики вы использовали для оценки качества retrieval и ранжирования?
6. Как замеряли качество генерации LLM?

Оптимизация и ускорение инференса
1. Какая скорость инференса была?
2. Рассчитывали ли вы нагрузку на систему?
3. Какие подходы ты бы использовал для ускорения инференса?
4. Включали ли вы KV cache?
5. Расскажи, как работает квантизация и дистилляция? Чем они отличаются?

Fine-tuning и PEFT
1. Какие методы тюнинга существуют? Чем они отличаются?
2. Что такое LoRA, QLoRA, Prompt Tuning, P-Tuning?
3. Как устроена LoRA и как она встраивается в LLM?
4. Чем отличается QLoRA от обычной LoRA?

Моделирование и системный дизайн (разрешительная документация)
1. Как бы ты решал задачу сопоставления карточки товара и разрешительной документации?
2. Что на выходе должно быть? Что сказать модератору?
3. Что делать, если в разрешительной документации много строк?
4. Как обработать названия и параметры шин?
5. Как бы ты находил маски (форматы) параметров шин?
6. Какой preprocessing ты бы использовал?
7. Как построить pipeline, где маски уже извлечены?
8. Как построить бинарный фильтр для соответствия товарной группы документации?
9. Как бы ты агрегировал финальное решение?

Классическое ML
1. Занимался ли ты классическим ML? Какие задачи решал?
2. Как строится решающее дерево?
3. Какие критерии ветвления и остановки знаешь?
4. Какие методы ансамблирования моделей знаешь?
5. Чем отличается Random Forest от бустинга?
6. Что произойдет, если удалить одно дерево в бустинге и в Random Forest?
7. Что такое теорема Байеса? Как выглядит её формула?

Подписываемся:
@zadachi_ds
  • 👍 3
  • ❤ 2
  • 🔥 1
Post #431 3.8K
Авито МЛ гaйд.pdf1.5 MB
Полный слив ML-собеса в Avito

Наши выпускники не только сейчас активно проходят собесы, но и уже давно закрепились в штате и проводят собесы. В честь стажировки в Авито (буткемп ДС, дедлайн подачи 20 сентября) сливаем всю техническую секцию. Разбор же тестового задания уже выложен только на наших курсах МЛ ПРО, ИИ агенты ПРО.
➡️ Записаться

Что внутри:

Основы ML (8 задач). Регуляризация, почему на практике не решают линейную регрессию через явную формулу, precision vs recall на реальной задаче модерации объявлений, AUC-ROC вдоль и поперёк, MAE vs MSE на выбросах, модификации градиентного спуска.

Ансамбли (5 задач). Беггинг и почему беггинг над линейными снова даёт линейный, устройство RandomForest, градиентный бустинг и его реализации (oblivious tree в CatBoost, leaf-wise в LightGBM), почему на проде под задержку часто берут GBDT, а не RF, и какие гиперпараметры GBDT крутить в первую очередь.

Computer Vision (3 задачи). Свёртки и пулинг, Inception module и Residual block на пальцах, как выжать скор на Kaggle без переобучения (TTA), и как отвечать на «расскажи последнюю статью, которую читал».

NLP (8 задач). Эмбеддинги от BoW до BERT, отличие encoder и decoder, self-attention и треугольная маска, positional encoding и RoPE, как достать эмбеддинг текста из BERT (CLS, пулинг, SentenceBERT), даст ли BERT разумный эмбеддинг слову «подкрадули» (да, wordpiece), BERT на Question Answering.

Продвинутые темы (2 задачи). Регуляризация нейросетей (batchnorm, dropout и как он работает на инференсе) и открытый кейс про классификацию аккаунта по его окружению — Deep Sets, GAT и почему тут важна инвариантность к порядку.

По каждому вопросу не только правильный ответ, а как его объяснить: закрыть пробелы, сверить формулировки и научиться объяснять идею, а не просто пуляться терминами. Кстати все вопросы закрываются нашим курсом Data Science.

Еще больше материалов в наших открытых банках собесов.
Аналитика
ML & DS
Бэкенд
Фронтенд
Алгоритмы
Обсудить задачи можно в нашей боталке.

Подписаться: @zadachi_ds
  • 🔥 7
  • ❤ 5
Post #430 2.79K
Стажировка Авито (Data Science Bootcamp)

В посте обсудим основные этапы отбора. Направления: классика, CV, NLP и LLM - при подаче выбирается только одно. Для участия нужно подать заявку до 20 сентября и выполнить тестовое задание. Разбор будет только на наших курсах МЛ ПРО, ИИ агенты ПРО.
➡️ Записаться.

1. Скрининг-тест
Тест по Python, SQL, матеше и ML - около 30 вопросов, из них 2 задачи на код, остальное теория. На каждый вопрос дают около минуты, сворачиваться или переключать вкладки нельзя - если задетектит скрин, об этом напишут и результат не засчитают (но сам тест доходишь до конца). В конце теста ещё пара лёгких задач на код. Пример можно посмотреть тут.

2. Тестовое задание + видеовизитка идут параллельно по дедлайну
Формат тестового зависит от направления:
- построить модель и придумать фичи, чтобы повысить целевую метрику (классика)
- задание в формате хакатона: например, написать ретривал-систему и максимизировать MAP@10 (на NLP было такое)

Видеовизитка - тут типичная запись себя на вебку с ответами на простые вопросы вроде "кто ты", "почему Авито", "почему DS", тоже с лимитом около минуты на ответ. Такое же есть и на стажку от Авито, поэтому ничего нового. Пример можно посмотреть тут, а как готовиться к софт собесам в Авито писали пост.

3. Технический собес
- Иногда ~10 минут обсуждают твоё тестовое, но бывает, что вообще не спрашивают про него.
- Задача на алгоритмы уровня LeetCode (medium). Сливали материалы тут.
- Блок по классическому ML: деревья, ансамбли (бэггинг, бустинг, стекинг), регуляризация, дропаут, метрики, нормализация и т.п.
- Если направление NLP дополнительно спрашивают эмбеддинги, word2vec, трансформеры, TF-IDF и подобное.

4. Финал
В основном это знакомство с командой и рассказ о том, чем предстоит заниматься. Технических вопросов обычно нет, но некоторые слышали, что иногда бывают. В целом классический финал, как например в том же яндексе/авито/тиньке.

При мэтче год стажируешься, заполняешь матрицу компетенций (подтвержение навыков) и в конце буткемпа тебе проводят собесы, по которым принимают решение какой грейд тебе давать - мидл или джуна оставлять. Пример собесов тут.

Подписаться: @postypashki_old
start.avito.ru Data Science Bootcamp Поможем освоить нужные навыки, отработать их на практике и узнать всё, чтобы получить первый оффер
  • ❤ 6
  • 🔥 4
Post #426 4.24K
Мы разобрали 160 с лишним вакансий, чтобы понять, чем миддл в ML на самом деле отличается от джуна

Об этом любят рассуждать в комментариях, а вот цифр под рукой обычно ни у кого нет. Мы решили их добыть

Взяли свежие вакансии ML-инженеров на hh.ru: чуть больше 60 джунских и стажёрских и около сотни миддловых, где просят от трёх лет опыта. Для каждого навыка посчитали, в какой доле вакансий он встречается. Все цифры на карточках к посту, здесь только самое интересное.

Начнём с того, что совпадает. Ядро у обоих уровней одно. Python требуют от 88 процентов джунов и 86 процентов миддлов, PyTorch поровну, классический ML у джунов даже чаще. Зато математику у новичков спрашивают почти вдвое активнее: тервер и линал упомянуты в 17 процентах джунских вакансий и только в 10 миддловых. Логика понятная. Пока опыта нет, проверять больше нечего, кроме теории. У стажёра в Яндексе в требованиях алгоритмы и основы ML, про прод ни слова.

А вот дальше списки расходятся, и расходятся по инженерной части. Kubernetes у джунов просят в 17 процентах вакансий, у миддлов в 40. С CI/CD та же картина, 17 и 40. Оптимизация инференса вырастает с 12 до 26 процентов, Kafka с 10 до 21, мониторинг ровно вдвое. Росгосстрах хочет от миддла Docker, Kubernetes, Airflow, MLflow и Grafana одним списком, и СОГАЗ с ним полностью согласен.

Чего мы не ожидали, так это цифр по LLM. Языковые модели, RAG и GenAI упоминаются в 61 проценте миддл-вакансий. Для сравнения, Docker встречается реже. Про «модную приставку к резюме» можно забыть, это уже обычное требование, как когда-то SQL.

Если перевести всё это с языка вакансий на язык рабочего дня, получается примерно так. Джуну обычно достаётся кусок задачи. Почистить данные, собрать фичи, обучить бейзлайн, прогнать десяток экспериментов, принести табличку с метриками, и так по кругу. Пайплайн, куда это встраивается, кто-то уже написал, а что будет с моделью после обучения, решают без него. У миддла задача целиком. Он сам договаривается о постановке с бизнесом, сам заворачивает модель в сервис и вешает мониторинг. Дрейф должен заметить раньше пользователей, переобучить, когда пора, и не уронить при этом прод. Между делом ещё оценивает сроки, ревьюит чужой код и объясняет заказчику, почему метрика выросла, а деньги нет. Вот откуда в его вакансиях Kubernetes с CI/CD: иначе задачу целиком не довезти.

Собеседования устроены под это же. Джуна гоняют по теории: как работает градиентный спуск, чем L1 отличается от L2, почему accuracy врёт на несбалансированных классах, как ловить переобучение. Сверху алгоритмическая секция на Python и довольно часто тестовое на датасете. Пет-проекты смотрят и засчитывают. У миддла теория заканчивается минут через десять, а дальше начинается ML system design. Вот задача, нарисуйте систему от данных до инференса. Где мониторинг, что делаете при дрейфе, как выкатить новую версию без простоя, во сколько это обойдётся. Потом долго ковыряют прошлые проекты: что сломалось в проде, как чинили, что бы сделали иначе. Всё чаще отдельно спрашивают про LLM, как собирали RAG и чем мерили качество. Про три года опыта из требований на собесе вспоминают редко. Вопрос обычно один: сколько раз человек довозил модель до живых пользователей.

Получается, миддла делает не глубокая математика, а привычка доводить модель до прода. Нас это скорее радует: список навыков конечен, и за пару месяцев практики его реально закрыть, если не ходить кругами. Собственно, поэтому наш курс ML PRO устроен так, как устроен: FastAPI и Docker, Kubernetes, CI/CD, MLflow, Airflow, мониторинг с отловом дрейфа и дообучение LLM с выкатом в кластер. В конце блок по карьере: резюме, собесы, поиск вакансий.
➡️ Записаться.

Подписаться: @zadachi_ds
  • ❤ 3
  • 🔥 3
Post #425 2.65K
Гайд по МЛ собесам в Яндекс.pdf378.5 KB
Полный слив собеседований ML в Яндексе

Собрали для вас гайд, по которому в Яндексе сами интервьюеры готовятся вести технические секции на ML‑позиции: от общего MLP до профильных направлений NLP, ASR, CV и RecSys. Внутри разложено буквально всё: что спрашивают, какие задачи дают и по каким критериям ставят грейд. Еще больше материала на наших курсах ПРО. Разбор контеста на стажировку в Яндекс уже выложен!
➡️ Записаться

Как устроена сетка грейдов в файле:
- 14 грейд (hire2) — джун
- 15 грейд (hire3) — мидл
- 16 грейд (hire4) — мидл+
- 17 грейд (hire5) — синьор

Все кандидаты трека ML сначала идут через MLP
Это общая секция на ~60 минут: алгоритмическая задача на код + разговор про теорию ML на примере любимого алгоритма кандидата (логрег, нейронки или ансамбли деревьев). В файле выписано 31 вопрос теории: от того, почему в логрег логарифмируют правдоподобие, до того, как посчитать CTC‑лосс для пустого референса, ну и конечно разбор по каждому критерию: что нужно, чтобы не улететь в no‑hire.

После MLP кандидатов 15 грейда и выше ведут в MLS
Профильную секцию по одному из четырёх направлений:

• NLP: опыт кандидата + задача на пунктуацию/капитализацию + профильная (поиск багов в трансформере или пайплайн суммаризации)
• ASR: теория (архитектуры, лоссы CTC/RNNT, метрики WER/CER) + практическая задача end‑of‑utterance в реальном времени
• CV: практическая задача в реальном времени, самая частая - «типичные грабли»: дают кривую архитектуру и просят найти всё, что в ней не так
• RecSys: дизайн рекомендательной системы с нуля (по образу Ютуба) + профильная задача про кандидатогенерацию или прод‑проблемы

Отдельно стоит обратить на логи интервью с таймкодами, от кандидата, который не смог объяснить, что такое лосс в логреге, до кандидата, которого взяли сразу на 16+ грейд. По этим логам хорошо видно, где именно люди сыпятся и какие уточняющие вопросы задаёт интервьюер, чтобы докопаться до сути.

Если готовитесь именно по ML‑треку, то начните с MLP‑блока, там закрывается процентов 70 типичных вопросов по метрикам, переобучению и статзначимости, а дальше уже углубляйтесь в своё направление.

Подписаться: @postypashki_old
  • ❤ 5
  • 🔥 1
Post #424 4.29K
AI-агенты: что это за профессия, сколько платят и как туда попасть

Анализ от нашего преподавателя курса ИИ агенты ПРО (АIOps инженер WB).

1. Почему все вдруг захотели агентов
Всё началось с чатботов, и довольно быстро компании упёрлись в их потолок: бот умеет отвечать на вопросы, и на этом всё. Спросить статус заказа можно, а попросить найти заказ в базе, проверить оплату и оформить возврат уже нет. Агент как раз про второе. Он сам решает, куда посмотреть, какой инструмент дёрнуть, что перепроверить и когда пора остановиться. Если чатбот это справочная, то агент скорее стажёр, которому можно отдать задачу целиком и уйти на обед.

Как только это заработало не только в демках, за агентами пришли все, у кого много рутины. Поддержка хочет, чтобы агент сам лазил в базу заказов. Юристам нужно, чтобы он сверял договор с судебной практикой. В разработке он уже чинит issue и открывает pull request, а в аналитике превращает вопрос на человеческом языке в SQL и график. И нанимают под это давно не только Сбер с Яндексом. Из свежего: строительный стартап, медиахолдинг, исследовательский институт AIRI, Rambler.

2. Сколько платят
Цифры ниже из живых вакансий, а не из опросов. На входе 100–120 тысяч: столько предлагает ELEMENT джуну AI/ML-инженеру, причём опыт с LLM там принимают «хотя бы на уровне пет-проектов». С опытом год-три уже 150–300, это вилка того самого строительного стартапа. Старший разработчик агентов для Алисы стоит 253–508.

Чтобы было с чем сравнить: джун-аналитик данных, по данным hh, начинает с 81–109 тысяч в Москве и с 50–70 в регионах (источник). А зарплаты аналитиков в целом за полгода прибавили 5%, то есть не догнали даже инфляцию (ист). Агентные позиции стартуют примерно с тех же денег, что и московская аналитика, но дальше растут в разы быстрее. И толпы на входе пока нет.

3. Кто может этим заниматься
Порог входа здесь ниже, чем в классический ML. Градиентный бустинг наизусть и полгода матстата не понадобятся. Понадобится уверенный Python, понимание того, как устроены API, и терпение много экспериментировать, потому что с первого раза агент не работает почти никогда.

Поэтому в профессию приходят с разных сторон. Бэкендеры, для которых агент это просто ещё один сервис, только с необычной начинкой. Дата-сайентисты, уставшие двигать метрику в третьем знаке после запятой. Джуны после курсов: на классическом рынке им тесно, а тут пока свободно, дикий запад. Бывает, приходят аналитики, которые начали с промптов, потом втянулись и написали первый tool call. Из математики пригодится ровно одно: посчитать метрики качества так, чтобы не обмануть самого себя.

4. Что учить
Тут важен порядок, и большинство его нарушает. Первые недели стоит провести на чистом Python с LLM API напрямую, без единого фреймворка: собрать цикл ReAct руками, разобраться с tool calling и structured output. Кто сразу начинает с LangChain, потом не может понять, что именно у него сломалось, потому что никогда не видел, как оно устроено без обёрток. Дальше память и RAG: эмбеддинги, векторные базы, chunking. Потом уже фреймворки вроде LangGraph и smolagents, мульти-агентные схемы, MCP. И обязательно evaluation: датасет, LLM-судья, метрики. Это самая недооценённая тема во всей области. Под неё уже открывают отдельные позиции, а умеют её единицы.

Чего учить точно не надо, так это зоопарк из сорока фреймворков. Внутри они устроены одинаково, и кто один раз написал агента руками, разберётся в любом из них за вечер.

5. Что спрашивают на собесах
Вопросы уже устоялись, набор примерно такой. Как агент выбирает инструмент и что будет, если он зациклится на одном вызове. Чем ваш RAG лучше наивного и как вы это померили. Что такое prompt injection и что случится, если инструкцию спрятать в документ, который агент читает. Как сравнить две версии промпта не на глазок. И сколько стоит один прогон вашего агента в рублях.

Обратите внимание: ни одного вопроса в духе «напишите промпт».
Спрашивают про инженерию вокруг модели, и только про неё. Ответ «я собрал чатбота по туториалу» здесь не работает. А вот «вот репозиторий, вот метрики до и после» закрывает половину собеседования.

6. Что делать на работе
Промпты занимают процентов десять времени, а если писать агента с нуля, то и того меньше, один-два процента. Всё остальное выглядит куда прозаичнее. Читаешь трейсы и пытаешься понять, почему на конкретном запросе агент свернул не туда. Собираешь датасеты из реальных провалов. Гоняешь eval-пайплайн после каждого изменения, потому что поправил одно и незаметно сломал три. Режешь стоимость: кэширование, роутинг на дешёвые модели, батчи. Ставишь guardrails и проверяешь, что клиентский агент не сольёт системный промпт первому же шутнику. В общем, обычная инженерия. Просто в центре у неё недетерминированная штука, и от этого она заметно интереснее.

7. Что будет через год-два
Кое-что выглядит почти неизбежным. Обёртки вокруг API перестанут быть отдельной работой: простого агента соберёт кто угодно, а платить будут за надёжность и качество, то есть за evals и observability. Стандарты вроде MCP сделают инструменты взаимозаменяемыми, и выиграют те, кто понимает архитектуру, а не конкретный фреймворк. Ну и требования к джунам продолжат расти: то, что сегодня плюс в резюме, через год станет гигиеническим минимумом.

Сейчас спрос обгоняет предложение, и джуна с одним хорошим агентным проектом забирают быстро. Такие окна на рынке живут года два, потом закрываются.
Если хотите пройти этот путь не в одиночку: советую наш курс по AI-агентам. Шесть недель, от ReAct-агента на чистом Python до eval-пайплайна и деплоя.
➡️ Записаться.

Подписаться: @zadachi_ds
  • ❤ 7
  • 🔥 1
  • 🌭 1
Post #423 2.5K
Товарищи, Поступашкам нужны контент мейкеры в основной канал по DS/ML и другим дисциплинам. Если вы творческая личность, интересующейся алгоритмами (или другим), вам нравится писать посты/ придумывать идеи для контента, то обязательно пишите @vice22821. Оплата сдельная, ориентировочно за один пост от 2 тыс до 15 тыс рублей.

Обязательно делитесь с ребятами, которым это может быть интересно.
Telegram Поступашки - ШАД, Стажировки и Магистратура 5 лет помогаем получать офферы в BigTech, поступать в ШАД и проходить в топовые магистратуры. Вопросы, реклама: @vice22821 По покупке курсов: @menshe_treh Наши курсы: https://old.postypashki.ru/ Чат: @postypashki_old_chat Ютуб: youtube.com/@OfferBerry
  • 🔥 1
  • 🍌 1
Post #422 4.36K
Стажировка в Яндексе одна из лучших возможностей для старта в МЛ:

• МНОГО СВОБОДНЫХ ЖЕНЩИН
• специалисты высокого класса
• зарплаты в среднем выше рынка
• современный стек и проекты
• хорошо выстроены процессы
• корпоративная культура

Для участия нужно подать анкету заполнить анкету и зарешать контест. Разбор контеста уже выложен на нашем курсе мл про, аи агенты про.
Записаться.

Как заполнять анкеты смотрим этот ролик. После контеста вас ждет один алгособес на 2 литкод задачи medium и один технический собес: алгосы + ML. И наконец собеседования с командами. На моем опыте максимально, сколько может быть собесов с командой - 9.

Финальные собесы
Если команда точно понимает, что им нужен стажёр закрыть пару дыр и после он не нужен, то собес больше про твой опыт, почему Яндекс, как планируешь совмещать с учебой, а что будешь делать, если стажку не продлим/не возьмём в штат. Такие больше на метч с командой и посмотреть не будешь ли ты ныть, что на стажке будешь заниматься скучной фигней, расскажут какой есть пул задач и спросят, что из этого интересно. Обычно такое в продуктовые команды.

Если команде нужен специалист, которого они хотят растить, то собес посерьезней из разряда: МЛ систем дизайн, ML special и тд. Пример нашего выпускника можно посмотреть здесь.

Конкретнее все зависит от того, кто собесит: chill guy или факер. Выбирайте команду с умом, ее можно поменять.

Штат
Можно сразу на финале спросить, а будут ли места в штате. Конечно обмануть могут, но за вопрос денег не берут и пусть сила вам подскажет.

После стажировки есть несколько вариантов:
1. Если плохой отзыв от команды и говорят «уходи», то нужно заново проходить все собесы на стажера
2. Могут сказать, что ты не очень и иди на стажировку снова (без собесов, только финалы)
3. Можешь пойти в штат:
а) ты классный - можешь пойти к нам на миддла (но нужно опять пройти АА, потом финалы), если не пройдешь, то возьмут на джуна
б) ты не дотягиваешь до миддла - ты джун и если команда не готова взять джуна, то нужно идти искать, кто может взять к себе джуна самому
в) можно искать, кто готов взять к себе миддла/джуна и врубать свои навыки социальной инженерии на максимум

При идеальном мэтче, вы в Яндексе - поздравляю!

Подписаться: @zadachi_ds
  • 🕊 8
  • 🤓 7
  • ❤ 4
  • 🌭 2
  • 👀 2
  • 😇 2
  • 🔥 1
Post #420 4.93K
Стажировка в Т-банк одна из лучших возможностей для старта в МЛ:

• специалисты высокого класса
• зарплаты в среднем выше рынка
• современный стек и проекты
• хорошо выстроены процессы
• корпоративная культура

Для участия нужно подать анкету заполнить анкету до 6 сентября и выполнить экзамен. Разбор программирования уже выложен на нашем курсе мл про, аи агенты.
➡️ Записаться.

Как заполнять анкеты смотрим этот ролик. Вашу анкету оценивают рекрутеры, команды. Если вы им понравитесь, вас пригласят на финальное собеседование.

На собесе может быть все, что угодно на усмотрение интервьюера: могут быть даже математические задачи на логику в духе тюремных загадок. Обязателен лайвкодинг с задачами, которые часто подбирают под ваше направление. Метрики, общая суть линейных моделей, регуляризация, описать общий цикл обучения модели. Примеры собесов в Т-банк можно посмотреть в нашем канале @zadachi_ds по поиску ключевых слов "Т-банк"/"Тинькофф". Технические вопросы сильно зависят от команды. Иногда собеседование может пройти в формате "вайбчека" без технических вопросов, но это скорее исключение. Короче все, что есть в нашей программе курсов мл старт, мл про и дата сайнс.

Обычно финальный собес один на полтора часа. Если прям очень хорошо о себя завили в анкете и хорошо показали на собесе - команда может дать хороший отзыв и тогда вам могут предложить еще одно собеседование, но такое бывает редко. Дополнительный финальный собес можно получить, если податься на донабор, который проходит обычно спустя месяц основного набора.

При идеальном мэтче, вы в Т-банке - поздравляю!

Подписаться: @zadachi_ds
  • 🔥 3
Post #417 4.57K
Реальное МЛ собеседование на стажировку в Т-банк

Наш студент сделал расшифровку записи собеса, делимся с вами! Кстати, решение экзамена уже выложено на нашем курсе мл про, ии агенты про и алгоритмы про.
➡️ Записаться.

1. «Расскажи, как устроено дерево решений?»

Дерево решений – это модель, которая не использует градиентный спуск (как нейронки или логистическая регрессия). Вместо этого оно строит разбиения данных по принципу «жадного» перебора. На каждом шаге мы смотрим все признаки, все возможные пороги и выбираем то разбиение, которое даёт максимальный прирост чистоты (Information Gain).

А функции потерь у дерева в классическом понимании нет – это частая ловушка на собесах, когда интервьюер спрашивает: «А какая у дерева функция потерь?» Правильный ответ: «Её нет, мы максимизируем информационный выигрыш».

Критерии остановки: глубина, минимальное число объектов в листе или минимальное улучшение.
Сложность построения (если мы сортируем признаки): O(N·M·log N), где N – объектов, M – признаков. Это спрашивали, так что запомните.

2. «Как работать с категориальными признаками?»

• One‑hot encoding – для каждого уникального значения создаём отдельный столбец (1/0). Подходит, если значений не слишком много (иначе раздуваем данные).
• Target encoding – заменяем категорию на среднее значение целевой переменной для этой категории. Это круто, потому что учитывает влияние на ответ. Именно его по умолчанию использует CatBoost.
• Frequency encoding – заменяем на частоту встречаемости.

Но есть нюанс: некоторые модели умеют работать с категориями напрямую, без всякого кодирования (например, тот же CatBoost или LightGBM с параметром categorical_feature). Так что либо кодируем, либо оставляем как есть, если модель поддерживает.
Если сомневаетесь – проверьте оба варианта на валидации и выберите лучший.

3. «Расскажи про случайный лес: обучение, свойства, важность признаков»
Этот вопрос тянет за собой несколько подвопросов.

Обучение леса:
• Мы строим много деревьев, каждое на бэггинге – берём случайную подвыборку данных с повторением и случайное подмножество признаков. Это снижает дисперсию (переобучение), поэтому деревья в лесу можно делать глубокими – bias и так низкий, а дисперсия усредняется.
• Важность признаков в лесу считается двумя способами:
— по количеству разбиений (сплитов) с участием этого признака,
— по суммарному уменьшению impurity (например, Gini) при сплитах по этому признаку, усреднённому по всем деревьям.

Также есть универсальные методы, которые работают с любой моделью: permutation importance (перемешиваем признак и смотрим, как падает качество), а также библиотеки SHAP и ELI5.

4. «А теперь бустинг – в чём его отличие от леса?»
Здесь нужно чётко разделить.

• Бустинг – это последовательное построение деревьев, где каждое следующее дерево учится на ошибках предыдущего. Он нацелен на снижение смещения (bias), поэтому деревья в бустинге берут неглубокими (обычно глубина 3–6) – иначе они слишком сложные и переобучаются.
• Ключевое отличие от леса: в лесу деревья независимы, их можно удалять без особого ущерба (усреднение сглаживает). В бустинге же порядок критичен – самое важное первое дерево, если его убрать, вся композиция рухнет.

5. «Почему бессмысленно строить бустинг поверх линейных моделей?»

Потому что сумма линейных моделей – снова линейная модель. Если мы последовательно добавляем линейные алгоритмы, общая функция остаётся линейной, и мы не получаем никакого выигрыша в сложности. Только если мы добавляем нелинейные преобразования – но тогда это уже не «чистый» бустинг. Поэтому в качестве базовых алгоритмов для бустинга всегда берут нелинейные модели (деревья).

5. Метрики классификации
Тут был целый блок вопросов. Precision, Recall, F1, ROC‑AUC – стандартный набор.

• Почему F1 – это среднее гармоническое, а не арифметическое?
Потому что если одна из метрик (Precision или Recall) равна нулю, то среднее гармоническое даёт 0 – а это честно, модель никуда не годится. Среднее арифметическое дало бы 0.5, что вводило бы в заблуждение. А среднее геометрическое тоже даёт 0, но оно всегда выше гармонического, поэтому F1 – более пессимистичный и строгий показатель. Нам важна строгость.

ROC‑AUC – это вероятность того, что модель поставит случайный положительный объект выше случайного отрицательного. Простыми словами: качество ранжирования. Если заказчик не в теме, я объясняю так: «Мы смотрим, насколько хорошо модель отделяет единицы от нулей при любом пороге».

Для многоклассовой классификации есть два вида усреднения:
• макро‑усреднение: сначала считаем метрику для каждого класса отдельно, потом берём среднее. Используем, если важен каждый класс (например, редкие болезни).
• микро‑усреднение: считаем общую метрику по всем объектам сразу. Используем, если важен общий результат (например, качество на всех клиентах). При дисбалансе классов эти показатели могут сильно отличаться.

6. Практическая задачка
Интервьюер дал таблицу с предсказаниями, отсортированными по убыванию вероятности, и попросил посчитать ROC‑AUC. Я, честно говоря, поленился считать, но объяснил принцип: нужно для каждого порога построить точки (FPR, TPR) и взять площадь под кривой. По отсортированным данным это легко делается через сумму рангов положительных объектов. Формулу я там не приводил, но суть понял.

7. Ошибка в коде
Показали кусок кода обучения модели и спросили: «Что здесь не так?»
А там забыли zero_grad() перед вызовом step() в PyTorch – градиенты накапливаются, и модель обучается криво. Это частая ошибка джунов. Проверяйте всегда!
Вот такие вопросы были. Как видите, ничего запредельного – но нужно чётко понимать теорию и уметь объяснять на пальцах.

Еще больше вопрос в нашем открытом банке собесов и тестовых заданий: смотрите на сайте.

Подписаться: @zadachi_ds
  • 🔥 11
  • ❤ 4
  • 🫡 1
Post #416 3.07K
ИИ-инженеры зарабатывают 300к/наносек!

В вебинаре разобрали, что сегодня ждут от начинающего АI-специалиста: какие темы проверяют на технических интервью, как выглядят реальные кейсы и почему сейчас это самый простой способ вката в МЛ. Смотрим! Смотрим!

https://www.youtube.com/watch?v=0TiWWZwt43Y

И да: в конце записи спрятан промокод на мощную скидку.
YouTube Как зарабатывать 300к/наносек сейчас | ИИ-агенты сделают тебя богатым Enjoy the videos and music you love, upload original content, and share it all with friends, family, and the world on YouTube.
Post #414 5.86K
Что спрашивают про трансформеры на собесах в 2026 году

Собрал вопросы по горячим следам: с собесов наших студентов, чтобы вы знали к чему готовиться.

1. Предобработка: BPE и тд
Эти вопросы чаще летят в ML Ops или в ML SWE, но и чистым моделистам тоже могут прилететь. Суть реализовать какой-нибудь пайплайн обработки данных. Самый частый гость токенизация через BPE.
BPE красивый и интуитивный алгоритм, но реализация требует возни со словарями, списками и краевыми случаями.

2. Классика: написать self-attention на NumPy

Удивительно, но задача «напишите ванильный self-attention» до сих пор жива. Причём в том же виде, что и пару лет назад. И, что ещё удивительнее, многие кандидаты с ней не справляются.
Но суть не в том, чтобы просто написать код. Это только повод для дискуссии. Дальше начинаются детали:
• зачем вообще нормировать QK на корень из размерности?
• как сделать softmax стабильным численно?
• как посчитать Q, K, V одной матричной операцией?

3. Сэмплинг
Greedy Decoding - это для дебага. В продакшне используют вероятностные методы, и интервьюеры это знают. Поэтому сейчас часто спрашивают про стратегии сэмплинга.
Самый популярный вариант: top-p. Хорошие примеры реализации можно найти на разных ресурсах (например, ComfyAI, там вообще кладезь). Кстати, полезно уверенно владеть матричными фреймворками: Torch, NumPy, JAX. Чтобы если попросят реализовать что-то нестандартное (типа min-p), не растеряться.

4. Inference Loop
Здесь проверяют, как вы взаимодействуете с архитектурой модели на уровне тензоров. На вход: тензоры, на выход — тензоры. Но есть нюансы: надо хранить кэш, логиты, ещё что-то.
Это требует детального понимания того, как трансформер работает внутри. Полезно порешать похожие задачи на специализированных платформах (например, NeetCode). Там есть задачи и про GPT.

5. ML Debugging

Самый свежий формат. Вам дают ноутбук с кодом нейросети или пайплайном и просят найти баги. Всё.
Я встречал такой формат в зарубежных бигтехах. Дали код GPT2, где было сломано буквально всё: модель выдавала NaN на второй итерации. Надо было поправить и добиться адекватного падения лосса. Другой кейс — модель выдавала разные ответы на одни и те же входы. Надо было найти все источники недетерминированности.

Еще больше вопрос в нашем открытом банке собесов и тестовых заданий: смотрите на сайте.

Подписаться: @zadachi_ds
  • ❤ 9
  • 🔥 2
Post #412 3.51K
Яндекс приглашает школьников на бесплатные Кружки по математике, программированию и ИИ

Кружки открыты для школьников 5–11 классов, а занятия ведут преподаватели с опытом участия в олимпиадах, работы в жюри и подготовки сборных. Программа рассчитана на учебный год (с сентября по май) и построена на сочетании лекций, семинаров, тематических контестов, пробных олимпиад и зачётов и дистанционных туров.

Всего три направления:

🔸Олимпиадное программирование (6–11 классы). Углублённое изучение алгоритмов и структур данных. 5 параллелей с разными уровнями сложности — для начинающих и продвинутых олимпиадников. Регистрация уже заканчивается.
🔸Олимпиадная математика (5–11 классы). Программа включает алгебру, геометрию, комбинаторику, теорию чисел. Есть базовый трек для уверенного освоения и профильный для подготовки к заключительным этапам ВсОШ и перечневым олимпиадам.
🔸Искусственный интеллект (8–11 классы). В курсе: Python, анализ данных, нейросети, большие языковые модели и подготовка к профилю ВсОШ по искусственному интеллекту.

Обучение бесплатное. Успейте подать заявки: до 30 августа — на олимпиадное программирование, до 6 сентября — на Кружок по ИИ и олимпиадную математику.
  • ❤ 4
  • 👍 2
Post #411 2.17K

Forwarded from Поступашки - ШАД, Стажировки и Магистратура

Выходим на новый уровень с линейкой 1️⃣1️⃣1️⃣

Товарищи, если база уже есть, то следующий шаг — углубиться в специализацию, закрыть пробелы, освоить новые инструменты и стать сильнее как специалист.

Для этого мы запускаем ПРО — углублённые карьерные курсы для тех, кто хочет качать карьеру и заработок! Для записи и вопросов — пишите менеджеру

📎Курсы ПРО подойдут тем, кто:

— уже знает основы и хочет глубже разобраться в своей специализации
— хочет перейти с junior на middle и расти дальше
— готовится к собеседованиям на более сильные позиции
— хочет сменить роль и добрать недостающие навыки
— уже на старте имеет сильную базу и хочет целиться выше стажёрских и junior-позиций

➡️Действует гарантия: прошел курс, выполнил все рекомендации, но не получил оффер — вернем деньги
➡️Курс длится 6 недель: теория, практика, домашние задания и пет-проект. Всё это время рядом преподаватель и куратор.

Открываем сразу 5 направлений:

➡️Аналитика ПРО
Продвинутый SQL, A/B-тесты, эконометрика, Causal Inference и ML.


➡️ML ПРО
Вывод модели в прод, MLOps, рекомендательные системы, ранжирование, uplift и динамическое преобразование.


➡️Backend ПРО
Многопоточка, System Desgin, Микросервисы, базы данных, кеширование, мониторинг и распределённые системы.


➡️Алгоритмы ПРО
Продвинутые алгоритмы и задачи для сложных технических интервью в hft фонды, faang+, для олимпиад и контестов.


➡️ИИ-агенты ПРО
Будем разбираться не просто в LLM. Вы научитесь проектировать полноценные агентные системы и за курс соберём 5 собственных AI-агентов и пройдём весь путь от архитектуры и инструментов до работы с RAG, multi-agent системами, MCP, evals и деплоем.


В программу всех курсов войдет:

🔵закрытый банк вопросов с интервью топовых бигтехов
🔵разбор ближайшей стажировки в Т-банк и Яндекс
🔵mock-собеседования с обратной связью
🔵рефералка в бигтех после защиты пет-проекта
🔵карьерная стратегия: резюме, поиск вакансий, подготовка к HR секциям

💰Бонус для всех записавшихся до 23.08 — курс про поиск валютной удалёнки и работы за рубежом в подарок
Older posts →

About this channel

How can I read @zadachi_ds without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Задачи DS - Собеседования, Соревнования, ШАД: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Задачи DS - Собеседования, Соревнования, ШАД have?
Задачи DS - Собеседования, Соревнования, ШАД (@zadachi_ds) has 8.25K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Задачи DS - Собеседования, Соревнования, ШАД know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →