TGViewer
Channel Public Channel
DziS Science | Data Science

DziS Science | Data Science

@dzis_science

Канал о жизни через призму науки о данных




Учусь сам, учу других
Пишу интересные статьи о соревновательном и коммерческом DS и его приложениях к жизни.

Создатель: @a_dzis
Subscribers
2.2K
Photos
475
Videos
25
Links
332
Recent Posts 19 shown
Post #825 262
Привет всем!👋
Напоминаю, что уже завтра состоится Practical ML Conf.

Очень классная конференция, которую настоятельно рекомендую к просмотру и посещению.

Но, к сожалению, очередная конференция, которую я не смогу посетить.

Только залечил травмы, полученные в отпуске, как оказался во вторник на операционном столе с острым аппендицитом.

На данный момент все еще нахожусь в госпитале, иду на поправку, но все что связано с каналом и активностям на работе и вне работы пока речи не стоит. Берегите себя!

#life
  • ❤ 12
  • 🙏 11
  • 💔 4
Post #824 463
Привет всем! 👋

Безопасность GPT-6 Astra взломали самым простым способом: модель понимает текст в неправильной раскладке, а защитные фильтры — нет.

Исследователю удалось заставить Astra повторить заблокированное слово «биооружие» и дать согласие помочь со взломом сайта (при обычной раскладке запрос блокируется).

Уязвимость не работает со всеми языками: срабатывает для английского и кириллицы, но не для турецкой раскладки.

Аналогичное поведение замечено у Fable 5.

#офтоп
  • 🤔 7
  • 👍 1
  • 🔥 1
  • 😱 1
Post #823 475
Привет всем!👋

Отличного воскресного вечера. Спешу сообщить, что я активно включился в Kaggriculture и уже начал "нюхать" конец медальной зоны.

До конца соревнования 17 дней, куча народа и уж очень хочется попробовать дотянуться до серебра на ней.

А как у вас дела, участвуете?

#соревнования
  • 🔥 8
  • ❤ 4
  • 👍 3
Post #822 499

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 13
  • 🔥 7
  • 😁 5
Post #821 345

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 9
  • 🔥 4
  • 👏 2
Post #820 415
DziS Science | Data Science Привет всем!👋 🚨Новое соревнование на Kaggle!🚨 На платформе стартовало соревнование Kaggriculture. Буквально веселый фермер, только ИИ версия. От старта соревнования прошло 10 дней, но соревнование симуляционное, так что времени на подготовку у вас предостаточно.🐱…
Привет всем!👋

На Kaggriculture побита отметка в 8500 команд, а это значит 850 медалей.

Настоятельно рекомендую поковыряться и попробовать побороться за медали. На принятие решения есть еще 14 дней.

Пока вкатываюсь в рабочий режим, но думаю в ближайшее время плотно возьмусь за соревнование.

#соревнования
  • 👍 7
  • 🔥 5
  • ❤ 4
Post #819 624
Привет всем!👋
Сегодня был бешеный план сходить на deep tech night от Яндекса.

-В чем же заключалась бешенство плана?
Кто внимательно следит за каналом, знает, что я был во 🇻🇳.
План был том, что я планировал быть на мероприятии под конец буквально «с корабля», после легкого 10ти часового перелета из Хошимина в Москву, но задержки как и во Вьетнаме, так и уже в РФ не дали мне такой возможности, так как там надо было появиться до 19:40, учитывая что буквально 20 минут назад я выехал из Шереметьево.

Развожу руки🤷‍♂️, еду на такси домой, и делаю всем хороших выходных!

P.S.: расскажите хоть что там было, если вы офлайн.

#life
  • 😭 5
  • ❤ 3
  • 🔥 2
Post #818 669
Привет всем!👋
Поздравляю всех причастных с Днём знаний!🍁🎒

Желаю всем хорошего и продуктивного старта учебного года.

Для многих новый учебный год - новый шаг/ступень в жизни🤗.

🔸Для кого-то новый год ознаменовал поступление в бакалавриат/магистратуру📖.
🔸Для кого-то это начало преподавательской деятельности. Или ее успешное продолжение. Как я неоднократно говорил учить людей - одна из самых сложных и уважаемых профессий🫡.
🔸Для кого-то это год - затишье перед бурей, где впереди ждут важные испытания для перехода на новый жизненный этап💻.
🔸Кто-то будет переживать за вас из ваших близких за ваши учебные успехи и неудачи, собирать в школу и институт🚬.

Всех, к кому относятся эти пункты я поздравляю в первую очередь. 😺

Но самое важное, что я всегда регулярно повторяю: учебные года не ограничены учебой в школе/институте. Здесь в мире после института тоже есть ступени, просто они не такие явные, как во времена учебы.

Чтобы оставаться на волне и быть конкурентным на рынке, учится в нашей профессии нужно круглосуточно.


Поэтому желаю всем в этом учебном году интересоваться: освоить что-то новое, изучить новые технологии, разобраться в чем-то фундаментальном или попробовать для себя что-то новое.

Ведь вы не станете крутыми спецами, если не будете интересоваться. Не бойтесь ошибаться, ведь не ошибается только тот, кто ничего не делает.

Так что полный газ и попутного ветра!🏃‍♂️

В последнее время не так активно работает дискуссия, но я бы хотел в комментариях разделить ваши успехи перед данным учебным годом, фото первого учебного дня в новом статусе. Пишите в комментариях кто куда поступил, кто где учится, возможно встретите однокурсников/одногрупников👇

#офтоп
  • ❤ 10
  • 👍 5
  • 🔥 4
  • 🙏 1
Post #817 729
Привет всем!👋

Последние 2 недели выдались продуктивными. Немного расскажу.

Про работу:
По работе мы почти вывели модель PD ЭБГ (электронные банковские гарантии) в прод, по модели PD среднего бизнеса согласование ТЗ превратилось в ресерч уровня научной статьи.

На этой неделе также случился корпоратив ДРМ, наше подразделение с размахом отметило свое день рождение.

По соревнования:
Честно говоря времени было не много, прорыва в «Счастливом фермере» на данный момент не произошло, сокомандник, который пока останется инкогнито, провел не плохую оптимизацию и тем самым ускорил пайплайн в 6 раз, собственно мы готовы уже активно бороться за медали.

Что сейчас:
На данный момент я собираюсь в отпуск, продлевать лето платно, во 🇻🇳. Поэтому пока все активности на 2 недели приостановил. Сгонял кстати на Одиссею в IMAX на выходных, мне зашло.

Про спорт и здоровье:
Собрался с друзьями в Падел, организовав элитный клуб тех, кто не умеет играть в падел. Уже как 2.5 месяца стабильно в выходные играем.
Кроме того, последние фото меня навели на мысль, что я мягко говоря отъелся, поэтому начал жестко контролировать калории, за месяц -6кг.

В целом думаю, в рамках анонсов этого достаточно, напишите про что из этого интересно почитать и буду начинать писать уже более глубокие посты про эти все мероприятия.

#life
  • 👍 8
  • 🔥 5
  • ❤ 4
Post #815 791
DziS Science | Data Science Привет всем!👋 🚨Новое соревнование на Kaggle!🚨 На платформе стартовало соревнование Kaggriculture. Буквально веселый фермер, только ИИ версия. От старта соревнования прошло 10 дней, но соревнование симуляционное, так что времени на подготовку у вас предостаточно.🐱…

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 5
  • 😁 5
Post #814 1.16K
Привет всем!👋

🚨Новое соревнование на Kaggle!🚨

На платформе стартовало соревнование Kaggriculture. Буквально веселый фермер, только ИИ версия.

От старта соревнования прошло 10 дней, но соревнование симуляционное, так что времени на подготовку у вас предостаточно.🐱

Лично я рассматриваю это соревнование как отдушину от лютого стака моделей в ROGII, где можно почилить и попилить RL стратегии.

-В чём задача?🚜
Здесь всё максимально нетривиально: нужно построить автономного AI-агента, который управляет виртуальной фермой — сажает и собирает урожай, ухаживает за скотом, нанимает работников, расширяет земельные участки и торгует на динамическом рынке, где цены реагируют на спрос и предложение. Соревнование организовано Kaggle совместно с Google.

- Что по механике?🤨
Одна игра - это сезон длиной 30 дней (720 ходов, ход = игровой час). Ваши агенты играют лестничные (ladder) матчи против других участников, и по итогам каждой партии обновляется рейтинг. По каждому завершённому эпизоду доступен полный реплей - все наблюдения и действия обоих игроков по ходам, так что материала для анализа чужих стратегий будет более чем достаточно.
Это скорее не классический supervised-таск, а стратегическая симуляция уровня Lux AI / Halite - заходит тем, кому интересны agentic AI, планирование и multi-agent взаимодействие.

Призовые💰
Общий призовой фонд - $50,000.
Распределение простое:
🏅 Топ-10 команд получают по $5,000 каждая.

- Что по метрике?🎯
Метрика тоже нестандартная - это не RMSE и не accuracy, а итоговый банк (доход) вашего агента по итогам партии на лестнице, из которого и складывается рейтинг.

- Что по срокам?📆
🔸Дедлайн регистрации/объединения в команды: 24 сентября 2026

Раз метрика - это доход агента в динамичной экономике, чистый RL «в лоб» может не зайти лучше эвристик — рынок и ограниченные ресурсы (земля, рабочие руки) сильно влияют на стратегию. Тестируйте разные подходы: от rule-based ботов до полноценных RL-агентов, комбинируйте их и смотрите реплеи чужих матчей - там реально можно многое подсмотреть.

#соревнования
Kaggle Kaggriculture Create an agent to play in this farming simulation and compete with others to maximize your income
  • ❤ 6
Post #813 655
Привет всем!👋
Сегодня на IT-Пикнике залетел на сходку Саши Абрамова (ака Dealer.ai)
Замучил вопросами про карьеру и получил лично от него мерч Вкусвилла.

#life
  • 👍 5
  • 🔥 3
  • 😍 3
  • 😁 1
Post #812 714
2/2
Архитектура итогового сабмита:
Два независимых стека, финальный бленд:

🔸Part A - физика. 128-сидовый likelihood-weighted particle filter (ANCC-anchored, Z-velocity coupled, numba), поверх — селектор кандидатных путей + robust low-degree полиномиальная проекция. На выходе anchor.

🔸Part B - ML-стек (fleongg). LGBM×3 + CatBoost×2 + Ridge-мета. Ключевая инженерная деталь - два спатиальных импьютера, FormationPlaneKNN и DenseANCCImputer, которые тянут признаки формаций (ANCC/ASTNU/…, есть только в train) с ближайших соседних скважин; на train-объектах вызываются с self_wid, который исключает саму скважину из выдачи соседей. Поверх - physfeats: self-log + neighbor-dip признаки, инъекция весом W_HARD=0.3 в финал ветки.

Поверх обеих веток:
🔸 HMM (forward-backward, self-log emission), вес HMM_W
🔸 kriging по датум-сдвигу b_w (locked-конфиг: TH=2.2166, ANISO=2.0, RNG=500, K=25, anisotropic variogram), вес krige_w; работает только за счёт соседей ближе ~500 ft (при исключении их из lookup сигнал схлопывается)
🔸 gold/contact-override - прямое восстановление TVT из формаций для скважин-дублей train <-> hidden
🔸 seed-branch hedge: когда посмертное распределение 128 PF-сидов бимодально (masса меньшей моды ≥0.25, разделение мод 4–40 ft), сдвигаем предсказание к взвешенной середине веток, капом ±2 ft; срабатывает на ~12% скважин

Финальная формула: pred = w_sp45·[(1−HMM_W)·anchor + HMM_W·hmm] + (1−w_sp45)·fleongg, затем + krige-сдвиг, + gold-override, + seed-hedge.

Валидация:
Итоговые веса финального сабмита были заточены под кросс-валидацию с GroupKFold(folds=5) по скважинам, при этом валидация была настроена для каждой части отдельно, итоговая валидация всей модели делалась на пересечении (по итогу на CV оценивались 370 скважин). Как показали результаты, CV отлично коррелировала с Private (итогова модель имела 9.004 против 9.038 на Private), но корреляция с LB была отрицательная, что и привело к огромному LB шафлу после соревнования.

Главный вывод:
Trust Your CV.
Public LB - маленькая (52 скважины), шумная подвыборка скрытого теста; CV370 - выборка на порядок больше. Ретроспективная проверка на private-скорах топ-89 сабмитов дала корреляцию Pearson +0.90 между CV и private LB - и отрицательную (−0.61) между public LB и private. Несколько раз в процессе мы отказывались от CV-оптимальных конфигов в пользу тех, что лучше смотрелись на public LB - и каждый раз это было ошибкой в противоположную от истины сторону.

Смелая попытка довериться CV до конца, невзирая на посредственный public-скор, принесла +168 позиций и бронзу. При этом ни оверфита, ни случайного выброса не произошло именно благодаря стабильности этой CV: 370 скважин с честными групповыми фолдами - выборка того же порядка, что и сам скрытый тест, поэтому и скачок получился большим, но объяснимым по величине, а не подарком генератора случайных чисел.

#соревнования
  • ❤ 7
  • 🔥 6
  • 👍 1
Post #811 595
1/2
Привет всем!👋
Вчера закончилось соревнование - ROGII - Wellbore Geology Prediction.
По результату соревнования наша команда забрала бронзу 🥉 заняв 525/6191 место. На Private LB мы поднялись на 168 мест.

Немного предыстории:
Я начал соревнование соло, но после общения в чате Псевдолейблинга на меня вышел парень, который слушал мое выступление в МФТИ "Я профессионал" и предложил поучаствовать вместе. Я согласился, также в рамках соревнования я начал впервые активно использовать вайбкодинг.
Fun Fact: Это соревнование - первое мое соревнование, в котором 90% работы за меня выполнил Claude Code.

Времени много кодить у меня не было, благодаря Claude я делал вечером дела в параллель, высвободив себе немного свободного времени, по сути руководя им как тимлид. Мы сделали довольно таки годный репозиторий, в который каждый сабмит и прогон логировался с комментариями, сохраняя версию ноутбука, проверяя кросс валидацию. Из смешного: файл с логированием сабмитов submission_history.csv начинался строго на английском, имел четкий численный идентификатор эксперимента (exp_001), но в конце уже полностью перешел на русский с потерей четкой структуры идентификации. Множественная потеря контекста привела к хаосу в документе и его пришлось в момент переписывать, это достаточно забавно.

Fun Fact: Название команды было предложено не мной, только в процессе работы я узнал, что это оказывается довольно-таки нишевый исполнитель.


Об экспериментах:

Их было много, спаршены все топ паблик кернелы, сгенерированы признаки из подсказок в discussions (далее по тексту physfeats), даже попробованы нейросетевые подходы. Топ-1 взяла UNet архитектура, мы тоже ее пробовали, но при увеличении кол-ва скважин, модель банально взрывалась по метрикам, побороть это нам не удалось.

Об итоговом сабмите:
Fun Fact: Сабмит, который принес нам бронзу был сделан последним, за пару часов до дедлайна. Он на Private показал топ-1 скор из всех, что у нас были.

По итогу, бросив нейросетевые подходы (решения аналогичного соревнования прошлого года и архитектура с Attention, Unet, поиск предобученных на HF), мы остановились на бленде из классических моделей (линейки, бустинги) с физическими фильтрами. Последние дни боролись именно за стабильность решения, в т.ч используя усреднение предсказаний по куче сидов (да-да finetuning сидов это база для Kaggle).

О архитектуре итогового сабмита и выводах ниже⬇️⬇️⬇️

#соревнования
  • 🔥 11
  • ❤ 2
  • 👍 1
Post #810 567
СЮДА БЛИН, LET’S GO

Пост нормальный завтра напишу уже, как проснусь
#соревнования

UPD: Никнейм придумал тиммейт, я в душе не чаю кто этот ваш королевский 17.
  • ❤ 7
  • 🥴 4
  • 🔥 3
  • 🌚 2
  • 🏆 2
  • 🤣 1
Post #809 532

Forwarded from Нескучный Data Science

От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬

Наконец-то дождались 🗿

Чуть больше года назад вы заполнили мой зарплатный опрос. Я обещал проанализировать результаты, но 695 анкет превратились в технический долг, о котором мне регулярно напоминали в комментариях.

Сегодня я этот долг возвращаю. Кажется, даже с процентами: вместо очередной таблицы «кто сколько получает» получилось большое исследование карьер в Data Science.

Да, за прошедшее время зарплатные вилки успели сдвинуться. Но карьерные зависимости никуда не делись, поэтому статья не только о суммах, а о профессиональном росте, удовлетворённости работой и готовности её сменить.

Внутри вас ждет лонгрид, где в том числе есть ответы на пять не самых очевидных вопросов:
1️⃣ Можно ли удержать недовольного дата-сайентиста высокой зарплатой и запереть его в золотой клетке?

2️⃣ Какие навыки помогут быстрее вырасти в грейде и больше зарабатывать?

3️⃣ Одинаково ли зарабатывают мужчины и женщины с одним грейдом и опытом?

4️⃣ Что дата-сайентисты хотят сказать Head of DS, когда отвечают анонимно?

5️⃣ Как часто дата-сайентисты *** и связано ли это с доходом и удовлетворённостью работой?

Ещё там премии стажёров, ШАД на скейтборде, зарплата CDS до 4,5 млн рублей 😳, переработки и попытка понять, где заканчивается развитие и начинается менеджмент. В анализ вошли 694 анкеты.

Спасибо «Start Career in DS»«DziS Science | Data Science»«girafe.ai»«Artificial stupidity»«LightAutoML framework» и «Борис опять»

👉 Читать на Хабре
  • 🔥 7
  • 👍 2
  • 💔 1
Post #808 617
Всем привет!👋
Мы дождались, обзор на вилки вышел!

#карьера
Post #807 761
Привет всем!👋

Сегодня одним из главных челленджей создания стратегии внедрения ИИ является постановка правильных и адекватных KPI для улучшения процессов без ущерба качеству. И мне всегда интересно, что для этого делают на рынке.

Яндекс запускает программу 75/75/75, которая должна сделать ИИ новым стандартом разработки внутри компании. И это, пожалуй, один из самых прямолинейных KPI по внедрению ИИ, что я видел.

- Что значат эти цифры?

🔸К концу 2026 года 75% процентов разработчиков будут использовать ИИ инструментарий для написания кода.
🔸ИИ должен принимать участие не менее, чем в 75% изменений в кодовой базе.
🔸В этих 75% изменений 75% процентов кода должно быть сгенерировано ИИ.

Выглядит как массовая ИИ-трансформация работы сотрудников, в которой классическая разработка остается только в редких, я бы даже сказал, особенных случаях.

Во остальных ситуациях подразумевается, что разработчик уже выступает в роли Product Engineer, т.е продукт лидируется человеком с точки зрения кода и бизнеса, но реализация возлагается на агентов.

- Какие вводные сейчас уже имеются?

Сегодня 73% разработчиков Яндекса регулярно используют ИИ, а более 50% нового кода в компании создается с помощью генеративных моделей.

При этом наибольшей эффективности достигают команды, где ИИ встроен в повседневный процесс разработки и используется при подготовке не менее 75% изменений кода. Сегодня так работают 17,2% разработчиков — за последний месяц их доля выросла более чем вдвое по сравнению с прошлым кварталом.


То есть стратегия 75/75/75 уже имеет место быть в Яндексе, но до целевых показателей еще далеко. Поэтому следующий этап - масштабировать этот подход на всю компанию.

- Есть ли реальные кейсы, когда такой подход помог ускорить разработку?


🔸 Яндекс Еда — создание ИИ-хостес за 2 месяца, разработка итогового продукта ускорилась в 2 раза
🔸Яндекс Браузер — 80% кода новой архитектуры перевода видео от ИИ, вместо 2-3 недель — 2 дня
🔸Яндекс Лавка — кабинет франчайзи собрал один человек за 3 недели, спринты ускорились в 3,3 раза

Ответственность за реализацию и архитектуру всё еще остается на человеке. Подразумевается, что ИИ берет на себя именно рутинную разработку.

И это переворачивает игру. Сдвиг рынка происходит в сторону специалистов, отлично умеющих в архитектуру и код-ревью. При этом функции тимлида начинают выполнять гораздо больше инженеров: каждый «агентовод» становится своего рода руководителем собственной команды ИИ-помощников.

Вот тут интересно, как в данной парадигме будет происходит обучение и рост сотрудников (а компания, по последним новостям, планирует нанять рекордные 3200 стажеров в 2026 году), ведь больше кода, больше проектов требует больше операторов ИИ, но если сразу взять курс на "сеньорность", то произойдет кадровый разрыв.

- Как достигаются такие цифры?

Яндекс также активно развивает внутренних агентов и агентские платформы, которые направлены не только на разработчиков, а на всех сотрудников, например на бизнес аналитиков, продактов.

Из примеров внутренних агентов:

🔸GENA - сама доводит тикеты до готового кода
🔸"Стефания" - работает виртуальным сотрудником для 5 тысяч человек в неделю

Платформы для внешней аудитории:

🔸SourceCraft - платформа с встроенным агентским режимом для кода
🔸Yandex AI Studio - платформа для создания ИИ-агентов и приложений
Интересным является то, что платформенные решения сразу упаковываются в продукты для рынка. По-моему, это круто, учитывая, что у нас только начали появляться инструменты, разработанные в РФ, которые потенциально могут на дистанции составить конкуренцию зарубежным решениям.

Да, всем очевидно, что условноза неделю LLMки не обучишь, но любой шаг в этом направлении - шаг к тому, чтобы громко заявить о себе.

Мне нравится идея программы, но как она покажет себя в реальности - вопрос времени.
  • 👍 6
  • 🔥 6
  • 🏆 3
  • 👎 2
Post #797 606
Привет всем! 👋

Прямое включение из отпуска.

Нижний Новгород - классный город.

Красивые закаты, вкусная еда. Из минусов только колени - в среднем за день часы показывают 40+ пройденных этажей (кстати Кремль мы прошли полностью по кругу с перепадами высоты, аналогичными 20ти этажному дому).

Fun Fact: В Нижнем Новгороде есть довольно-таки большой аквапарк.


Принципиально выключился из какой-то профессиональной движухи на неделю, надо немного перезагрузиться. Так что ждите новостей, думаю со следующей недели.

А на десерт ловите фотоотчет.

#офтоп #life
  • ❤ 10
  • 👍 8
  • 🔥 6
Older posts →

About this channel

How can I read @dzis_science without a Telegram account?
TGViewer shows the public web preview Telegram publishes for DziS Science | Data Science: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does DziS Science | Data Science have?
DziS Science | Data Science (@dzis_science) has 2.2K subscribers on Telegram, refreshed roughly every 30 minutes.
Does DziS Science | Data Science know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →