TGViewer
Channel Public Channel
DataSciencePRO

DataSciencePRO

@ds1pro

Все нужное и полезное из мира дата сатанистов)
Subscribers
748
Photos
188
Videos
19
Links
339
Recent Posts 20 shown
Post #674 168

Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

matplotlib-cheat-sheet.pdf2.4 MB
📊 Matplotlib под рукой: всё главное для графиков и анализа

Сохраняйте, пригодится не раз.

📍 Навигация: Вакансии • Задачи • Собесы

🐸 Библиотека дата-сайентиста

#буст
  • 🔥 1
Post #672 361

Forwarded from [PYTHON:TODAY]

😰 Python-шпаргалка по работе с датой и временем!

Модуль datetime — твой лучший друг, если нужно работать с датами, временем или таймзонами.

🔥 Форматы путают все. Держи удобный список, который точно пригодится:

📅 Форматирование дат и времени:

* %a → короткий день недели (Mon)
* %A → полный день недели (Monday)
* %b → короткий месяц (Jan)
* %B → полный месяц (January)
* %d → день месяца (01–31)
* %m → месяц (01–12)
* %y → год без века (23)
* %Y → год с веком (2023)
* %j → день в году (001–366)

⏰ Форматирование времени:

* %H → час (24ч, 00–23)
* %I → час (12ч, 01–12)
* %M → минуты (00–59)
* %S → секунды (00–61, да, 61! 😅)
* %f → микросекунды (000000–999999)
* %p → AM/PM
* %z → UTC-смещение (+0300)
* %Z → таймзона (если есть)

* %U → номер недели (с воскресенья)
* %W → номер недели (с понедельника)
* %x → локальная дата
* %X → локальное время
* %% → просто знак %

Примеры:


from datetime import datetime

now = datetime.now()
print(now)
# 2025-09-03 13:41:30.123456


Примеры форматирования даты:


print(now.strftime("%A, %d %B %Y"))
# Wednesday, 03 September 2025

print(now.strftime("%a, %d.%m.%y"))
# Wed, 03.09.25

print(now.strftime("День года: %j"))
# День года: 246


Примеры форматирования времени:


print(now.strftime("%H:%M:%S"))
# 12:45:30

print(now.strftime("%I:%M %p"))
# 12:45 PM

print(now.strftime("Микросекунды: %f"))
# Микросекунды: 123456


👍 Сохрани, чтобы не гуглить каждый раз!

😁 Лайф | 📲 Зеркало Max

#python #doc #cheatsheet
  • ❤ 5
Post #670 433

Forwarded from Анализ данных (Data analysis)

Lakehouse — новый подход к данным, который убивает DWH и Data Lake

- Высокая вероятность, что массовый переход на Lakehouse начнётся в ближайшие 1-2 года — после того как первые игроки (Т-банк, Магнит, Ламода) уже доказали экономию и масштабируемость. Об этом в интервью «Коммерсанту» рассказал Леонид Савченков, руководитель продуктовой архитектуры платформы данных Yandex Cloud.
- Классические DWH на объёмах от 100 ТБ начинают тормозить: единственный способ — докупать серверы целиком, потому что хранение и вычисления сцеплены.
- Data Lake решал проблему объёма, но не давал нормального управления данными — отчёты строить было сложно.
- Lakehouse разделяет хранение и вычисления: можно нарастить мощности под «Чёрную пятницу» и не платить за лишнее место весь год.
- В отличие от Data Lake, здесь появляются строгие табличные форматы и управление данными как в СУБД.
- Узкое место — нужны спецы по Trino и Spark. Чудес не бывает.
- Для ИИ это идеально: вычисления можно выделить в отдельные мощности, не роняя основные отчёты. X5 уже построил бота по трендам молока в регионах.
- Через пять лет, вероятно, появится новая концепция. Если данных мало — старый DWH всё ещё дешевле и проще.

https://www.kommersant.ru/doc/8691430
  • 👍 1
Post #669 459
Немного классики!)
  • 👍 2
Post #667 667

Forwarded from rpuropuu [Greeg'O'Rii']

pandas 3.0 — самый крупный релиз за годы: новый str dtype по умолчанию вместо object, с поддержкой Arrow‑бекенда (если установлен PyArrow), более предсказуемой типизацией и лучшей экономией памяти.
​

Весь фрейм переведён на Copy‑on‑Write: любой срез/результат операции ведёт себя как копия, chained assignment больше не работает, SettingWithCopyWarning уходит в историю, а лишние df = df.copy() можно выкидывать.
​

Появился pd.col() как выражения поверх колонок: теперь вместо lambda df: df["a"] + df["b"] в assign/loc можно писать pd.col("a") + pd.col("b"), с поддержкой операторов и .str/.dt методов.
​

Для экосистемы важны Arrow PyCapsule/from_arrow()/arrow_c_stream для нулекопийного обмена (передача данных между библиотеками без физического копирования в памяти) с другими датафрейм‑движками, обновлённая политика депрекейтов с семейством PandasChangeWarning, а также пачка I/O‑улучшений (Iceberg, SQL DatabaseError, доработки Excel/Parquet/CSV).
  • 🔥 5
  • ❤ 1
Post #666 684

Forwarded from Мониторим ИТ

Анализ проекта VictoriaMetrics

Мальчишки и девчонки, а также их родители, как устроена VictoriaMetrics узнать не хотите ли? В этой статье вы узнаете структуру каталогов проекта и о предназначении различных файлов. А ещё там описаны некоторые проектные решения при разработке продукта.

Эту статью можно назвать продолжением цикла. Есть еще одна похожая, которую я уже публиковал в канале. Но там рассмотрено все немного под другим углом.
Post #665 646

Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

🆕 CUDA 13.1 переворачивает GPU-программирование

Наконец-то NVIDIA выпустила CUDA 13.1, и это не просто очередное обновление — это настоящий сдвиг парадигмы. Если вы когда-то пытались объяснить GPU, что делать с тысячами маленьких потоков (да-да, тот самый SIMT-модель), то знаете, что это сродни попытке управлять тысячью муравьёв одновременно.

💡 Что нового

CUDA 13.1 вводит tile-based programming. Вместо того чтобы двигать песчинку за песчинкой, теперь можно управлять целыми плитками данных. Представьте: вместо того чтобы таскать каждую песчинку в отдельности, вы берёте целый холм и переносите его за один раз. Магия, правда?

Что это значит для нас, Python-разработчиков и исследователей AI:
✔️ Прощай, C++ барьер: с CuTile можно писать высокопроизводительные ядра на чистом Python. Не нужен диплом магистра по C++.
✔️ Синхронизация с железом: современные тензорные ядра уже «думают» блоками данных, а софт теперь догнал железо.
✔️ Будущее уже здесь: поддержка Blackwell архитектуры и новых FP4/FP6 форматов ускоряет и делает эффективнее LLM.

Иными словами, программировать ускорители стало логичнее, чище и мощнее.

🔗 Ссылка на новость

🔹 Курс «Специалист по ИИ»
🔹 Получить консультацию менеджера
🔹 Сайт Академии 🔹 Сайт Proglib

🐸 Библиотека дата-сайентиста

#свежак
  • ❤ 3
Post #664 713

Forwarded from Data Secrets | Карьера

Кажется, Google готовится объединить SQL, Python и Spark в рамках Colab Enterprise

По слухам, поисковый гигант намерен создать единую среду для специалистов по машинному обучению, объединив SQL, Python и Apache Spark в одном месте.

Ясмин Ахмад, управляющий директор Google Cloud по обработке данных, отметил, что главным препятствием для эффективности в ML является необходимость переключаться между средами: получать данные с помощью SQL в базах данных и хранилищах, затем экспортировать их, загружать в блокнот и настраивать отдельный кластер Spark.

Как вы понимаете, это крайне неудобно. Поэтому Google представляет ряд улучшений для своих блокнотов Colab Enterprise в BigQuery и на платформе Vertex AI.

Кроме того, компания анонсировала следующие преимущества для разработчиков в блокнотах Colab Enterprise:
➖ Предварительный просмотр собственных ячеек SQL.
➖ Интеграцию собственного Data Science Agent, призванного помогать в анализе и разработке моделей.
  • 🔥 5
Post #663 631

Forwarded from Анализ данных (Data analysis)

📢 NVIDIA представила nvmath-python — библиотеку для Python, которая открывает доступ к возможностям фирменных математических библиотек (например, cuBLASLt) через удобный API.

Что умеет:
- работает с массивами из NumPy, CuPy, PyTorch и других экосистем;
- поддерживает тонкую настройку вычислений (precision, режимы умножений, epilog-операции);
- позволяет использовать расширенные оптимизации NVIDIA для ускоренной математики и ML-задач.

Проект пока в бета-версии, но уже можно попробовать:
https://github.com/NVIDIA/nvmath-python
  • 👍 1
Post #662 725

Forwarded from медиатрендс

Айтишники, забираем: open-source программу для просмотра таблиц В ТЕРМИНАЛЕ нашли в сети.

Она открывает файлы CSV, JSON, Excel и других таблиц прямо в терминале. Кроме того, у нее есть встроенный SQL-движок для фильтрации, джойнов и анализа прямо в терминале. И быстрый поиск с мульти-табличными операциями.

Пользуемся тут.

DevHub
  • 🔥 3
  • 🥰 1
Post #661 783

Forwarded from 4PDA Community

Просто ГИГАНТСКУЮ коллекцию ИИ-агентов выгрузили на GitHub: это не просто шаблонные сервисы, а реальные, готовые к запуску инструменты.

С ними можно:

— Автоматизировать соцсети.
— Создавать CRM-системы и базы данных.
— Настраивать чат-боты.
— Генерировать картинки и тексты.


Забираем — ТУТ
  • 👍 6
Post #660 728

Forwarded from Machinelearning

🐼 Pandas тормозит на больших данных?

NVIDIA показала, как ускорить его в 40 раз — без переписывания кода.

Команда NVIDIA провела эксперимент с 18 миллионами строк данных с фондовых рынков: они выполнили типичный анализ данных с помощью pandas на CPU, а затем тоже самое — на GPU, используя cudf.pandas.

Для примеры были взяты:
📉 Скользящие средние (50D и 200D)
📅 Недельная статистика закрытия рынков
🧊 В общей сложности ~18M строк

Результат впечатляет : удалось добиться**ускорения обработки данных в 20–40 раз

Код скрипта не менялся вообще — тот же pandas, но на GPU.

Это один из примеров, где ускорение достигается без переписывания логики кода.

🟡 Потестить самому можно в Colab
🟡 Другие примеры с кодом — здесь

@ai_machinelearning_big_data


#datasckience #ml #nvidia #gpu #pandas #python
  • 👍 8
  • ❤ 1
  • 🔥 1
Post #658 814

Forwarded from Machinelearning

✔️ СuML от NVIDIA: Scikit-learn на скорости GPU – без единой строчки нового кода!

Все мы любим scikit-learn за его простоту и мощь. Но что если ваши модели обучаются слишком долго на больших данных? 🤔 NVIDIA предлагает решение!

Вы берете свой обычный скрипт cо scikit-learn, добавляете всего две строки в начало, и он начинает работать в 10, 50, а то и 100+ раз быстрее на NVIDIA GPU! 🔥

✨ Как это работает?

Библиотека cuml от NVIDIA содержит супероптимизированные для GPU версии многих алгоритмов машинного обучения. С помощью простого вызова cuml.patch.apply() вы "патчите" установленный у вас scikit-learn прямо в памяти.

Теперь, когда вы вызываете, например, KNeighborsClassifier или PCA из sklearn:

▶️Патч проверяет, есть ли у вас GPU NVIDIA.
▶️Проверяет, есть ли в cuml быстрая GPU-версия этого алгоритма.
▶️Если да – запускает ускоренную версию на GPU! 🏎️
▶️Если нет (нет GPU или алгоритм не поддерживается) – спокойно запускает обычную CPU-версию scikit-learn.

Ключевые преимущества:

✔️ Нулевые изменения кода: Ваш scikit-learn код остается прежним. Добавляете только 2 строчки:
import cuml.patch и cuml.patch.apply().
✔️ Колоссальное ускорение: Получите прирост производительности на порядки для поддерживаемых алгоритмов (KNN, PCA, линейные модели, Random Forest (инференс), UMAP, DBSCAN, KMeans и др.) за счет мощи GPU.
✔️Автоматическое переключение между GPU и CPU. Ваш скрипт будет работать в любом случае.

Топ инструмент для всех, кто работает с scikit-learn на задачах, требующих значительных вычислений, и у кого есть GPU от NVIDIA.

👇 Как использовать:

Установите RAPIDS cuml (лучше через conda, см. сайт RAPIDS):


python
conda install -c rapidsai -c conda-forge -c nvidia cuml rapids-build-backend


Добавьте в начало скрипта:


import cuml.patch
cuml.patch.apply()


Используйте scikit-learn как обычно!

Попробуйте и почувствуйте разницу! 😉

▪Блог-пост
▪Colab
▪Github
▪Ускоряем Pandas

@ai_machinelearning_big_data


#python #datascience #machinelearning #scikitlearn #rapids #cuml #gpu #nvidia #ускорение #машинноеобучение #анализданных
  • 👍 3
Post #657 743

Forwarded from Анализ данных (Data analysis)

🐼 Pandas умирает медленной и мучительной смертью.

Это самая популярная в мире библиотека обработки данных, но она медленная, и многие библиотеки значительно превзошли ее.

Проблема альтернатив Pandas в том, что никто не хочет изучать новый API.

Давайте посмотрим правде в глаза: люди не будут переносить свои проекты, га другие фреймворки, без особой причины.

Я уже давно работаю с FireDucks 🦆

Эта библиотека в разы быстрее Pandas, и вам не придется менять код старых проектов для перехода на нее.

Вы можете изменить *одну* строку кода и весь остальной код будет работать на FireDucks :


import fireducks.pandas as pd


Вы также можете запустить свой код *не* изменяя ни одной строки, используя хук:

python 
$ python -mfireducks.imhook yourfile[.]py


FireDucks — это многопоточная библиотека с ускорением компилятора и полностью совместимым с pandas API.

Она быстрее, чем Polars. Ниже приведена ссылка на некоторые бенчмарки, сравнивающие Pandas, Polars и FireDucks.

FireDucks побеждает с отрывом.

⛓️Здесь находится репозиторий FireDucks на GitHub:
https://github.com/fireducks-dev/fireducks

⛓️Если вы хотите пощупать либу, откройте этот пример:
https://github.com/fireducks-dev/fireducks/tree/main/notebooks/nyc_demo

⛓️Если вы хотите сравнить FireDucks с Polars и Pandas, вот еще один блокнот:
https://github.com/fireducks-dev/fireducks/blob/main/notebooks/FireDucks_vs_Pandas_vs_Polars.ipynb

⛓️И наконец, бенчмарки, с которыми стоит ознакомиться:

https://fireducks-dev.github.io/docs/benchmarks/

⭐️ Подписаться: @data_analysis_ml

#fireducks #Pandas #dataanalysis #datascience #python #opensource
  • 🔥 15
  • ❤ 1
  • 👍 1
Post #656 748

Forwarded from Python Education

PandasGUI — графический интерфейс для работы с DataFrame

PandasGUI — это удобный инструмент, который предоставляет графический интерфейс для работы с Pandas DataFrame. Он позволяет визуализировать, фильтровать и редактировать данные прямо в интерактивном окне, что делает анализ данных более интуитивным и быстрым.

Python Education | #Python
  • 👍 3
Post #655 423

Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

🐼Сложная агрегация в Pandas с MultiIndex

В новой статье на «Хабре» объясняется, как

▫️создать мультииндекс и управлять его уровнями;
▫️проводить агрегацию данных с его помощью;
▫️работать со срезами данных по уровням.

🔗 Читать статью
  • ❤ 4
  • 👍 1
Post #654 706

Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

🐼Сложная агрегация в Pandas с MultiIndex

В новой статье на «Хабре» объясняется, как

▫️создать мультииндекс и управлять его уровнями;
▫️проводить агрегацию данных с его помощью;
▫️работать со срезами данных по уровням.

🔗 Читать статью
  • ❤ 4
  • 🔥 1
Older posts →

About this channel

How can I read @ds1pro without a Telegram account?
TGViewer shows the public web preview Telegram publishes for DataSciencePRO: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does DataSciencePRO have?
DataSciencePRO (@ds1pro) has 748 subscribers on Telegram, refreshed roughly every 30 minutes.
Does DataSciencePRO know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →