TGViewer
Channel Public Channel
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

@dsproglib

Все самое полезное для дата сайентиста в одном канале.

Учиться у нас: clc.to/6qVHgg

По рекламе: @tproger_sales_bot

Для обратной связи: @proglibrary_feeedback_bot

РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Subscribers
18.3K
Photos
2.8K
Videos
167
Links
5.4K
Recent Posts 18 shown
Post #7659 736
🌞 3 open-source инструмента для AI-агентов

🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам.
🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами.
🔘 Scrapling — быстрый scraping сайтов и извлечение данных.

Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • ❤ 5
  • 🔥 3
Post #7658 808
А вы уже забрали свой подарок ко Дню программиста?

К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS

Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw
Post #7656 1.15K
🤗 Fine-tuning LLM в Google Colab — без собственной GPU

Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab.

Что можно сделать:

1️⃣ Открыть готовый Colab.
2️⃣ Установить Unsloth Studio.
3️⃣ Выбрать модель.
4️⃣ Загрузить датасет — например, CSV или данные из PDF.
5️⃣ Запустить fine-tuning и экспортировать результат.

Подойдёт, чтобы:

— попробовать LoRA/QLoRA;
— адаптировать модель под свой формат данных;
— собрать небольшой synthetic dataset;
— разобраться с процессом дообучения LLM.


⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета.

🔗 Ссылка

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • ❤ 9
  • 👍 3
Post #7655 1.33K
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation

Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями.

В основе:

— predictive coding;
— локальные ошибки;
— множители Лагранжа;
— PI-регуляция.


🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах.

Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть.

Почему интересно:

— обучение остаётся локальным;
— подход ближе к идеям NeuroAI;
— потенциально полезен для нейроморфного железа.

⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко.

🔗 Статья
🔗 Код

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 5
Post #7654 1.29K
😭 Как не потратить недельный лимит AI-кодинга за три дня?

Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода.

🔘 Поговорим о том:

— когда дорогая модель действительно нужна, а когда хватит дешёвой;
— сколько стоит один прогон и куда уходят токены;
— какие задачи можно отдавать субагентам;
— как настроить маршрутизацию моделей;
— что проверять в AI-коде перед merge.

✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после.

⬇️ 17 сентября, 19:00 МСК
⬇️ 1,5 часа · бесплатно
⬇️ Арсений Харланов и Олег Лайок

💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре.

🔗 Зарегистрироваться на вебинар⁠
  • 👍 3
Post #7653 1.41K
🧠 DeepSeek-V4.1-Flash без встроенных ограничений

На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai.

Что заявлено:

🔘 MoE-модель на 552B параметров;
🔘 8B–16B активных параметров на токен;
🔘 FP8/FP4-квантизация;
🔘 контекст до 1 млн токенов;
🔘 поддержка изображений, инструментов и reasoning;
🔘 запуск через SGLang.


Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток.

📊 Результаты авторских тестов:

HarmBench: 100% ASR;
MMLU: 82,74% против 86,96% у базовой модели.

⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200.

🔗 ⁠Модель на Hugging Face

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 3
  • ❤ 1
Post #7651 1.32K
🌸 Вселенная намекает: пора уже начать этот курс

С 14 сентября цены в Proglib Academy вырастут на 20% 👀

Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏

📍 Выбрать курс
  • 👍 1
Post #7650 1.28K
⚡️ Шпаргалка: Bagging vs Boosting

👉 Bagging

Идея: несколько независимых моделей → усреднение.
Цель: снизить дисперсию (variance) и уменьшить переобучение.

Как работает:

✳️ делаем много бутстрап-выборок
✳️ обучаем модели параллельно
✳️ объединяем результаты (среднее/голосование)


Примеры:

✳️ RandomForestClassifier
✳️ RandomForestRegressor
✳️ BaggingClassifier
✳️ BaggingRegressor


👉 Boosting

Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей.
Цель: снизить смещение (bias) и повысить точность.

Как работает:

✳️ задаём базового слабого ученика
✳️ увеличиваем вес «трудных» объектов
✳️ комбинируем множество слабых моделей в одну сильную


Примеры:

✳️ GradientBoosting
✳️ XGBoost
✳️ CatBoost
✳️ LightGBM
✳️ AdaBoost


📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 3
Post #7649 1.17K
🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным

Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?


🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь.

Задавайте всё, что давно хотелось спросить 📍

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • ❤ 1
Post #7648 1.28K
🤔 Почему поиск понимает, что один документ релевантнее другого?

Например, запрос:


python machine learning


Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже?

🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов.

Он учитывает:

TF — насколько часто термин встречается в документе;

IDF — насколько термин редкий во всей коллекции;

длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.


Упрощённо:


score =
TF × IDF × поправка на длину документа


💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 5
  • ❤ 2
  • 🔥 2
Post #7647 1.4K
📊 Всё о непрерывном равномерном распределении

Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • ❤ 3
  • 👍 2
Post #7646 1.43K
🤩 Pixeltable — декларативная инфраструктура данных для AI

Единственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений.

С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД.

🤩 Особенности:

— Поддержка мультимодальных данных: изображения, видео, документы
— Инкрементальное хранение и трансформация данных
— Простая декларативная работа вместо множества систем


Установка:


pip install pixeltable


🔗 Документация и примеры

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 2
  • 🎉 2
  • 🔥 1
Post #7645 1.61K
🧠 Зачем Pipeline в scikit-learn

Частая ошибка — сначала преобразовать весь датасет, а потом разделить его на train/test:


scaler.fit_transform(X) # уже увидел весь датасет
X_train, X_test = train_test_split(X)


💡 Правильнее спрятать preprocessing внутрь Pipeline:


from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

model = make_pipeline(
StandardScaler(),
LogisticRegression()
)

model.fit(X_train, y_train)
score = model.score(X_test, y_test)


Теперь StandardScaler обучается только на X_train.

Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing.

🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 6
  • 🥰 2
Post #7642 1.74K
💡 GPT-6 Astra: модели уже работают как исследовательские агенты

OpenAI представила GPT-6 Astra — модель, которая делает заметный шаг от генерации ответа к долгим исследовательским задачам.

Что интересного:

— Astra умеет сохранять заметки между окнами контекста и искать по прошлым сообщениям и результатам инструментов;
— может работать с Blender, Excel, Power BI и браузером;
— на Terminal-Bench Science получила 64,6% на 70 командных исследовательских задачах;
— на BenchCAD — 95,9% на восстановлении CAD-программ по изображениям.

При этом Astra не стала безусловным лидером во всех тестах: в coding-бенчмарках результаты конкурентов находятся рядом.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • ❤ 2
  • 🔥 2
Post #7641 1.93K
ML_сборник.pdf2.4 MB
🌸 Если хочется не просто запускать model.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning”

Это сборник задач с решениями, где вы на бумаге разбираете:

— оптимизацию и линейную алгебру
— графические модели
— Variational Inference
— Monte-Carlo методы


📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 4
  • ❤ 1
Older posts →

About this channel

How can I read @dsproglib without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение have?
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) has 18.3K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →