TGViewer
Channel Public Channel
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

@dsproglib

Все самое полезное для дата сайентиста в одном канале.

Учиться у нас: clc.to/6qVHgg

По рекламе: @tproger_sales_bot

Для обратной связи: @proglibrary_feeedback_bot

РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Subscribers
18.3K
Photos
2.8K
Videos
167
Links
5.4K

Showing posts older than #7578 · Back to latest

Older Posts 20 shown
Post #7577 1.38K
✏️ Если вы уже работаете с Claude Code, Cursor или Copilot, этот вебинар будет особенно полезен.

Разберут, как превратить AI из инструмента для отдельных задач в часть инженерного процесса ⬇️
Post #7576 1.21K

Forwarded from Proglib.academy | IT-курсы

🧑‍💻 Учиться агентной разработке — у тех, кто уже внедряет её в бигтехе

Курс «ИИ для разработчиков» ведут практики из ведущих российских IT-компаний 🔥

🔵 Они прошли путь от первых экспериментов с AI до рабочих процессов, в которых агенты помогают команде писать код, готовить PR и быстрее доводить задачи до продакшена.

В ближайшее время познакомим вас с каждым преподавателем. Программа курса — по ссылке 🎹

🏃‍♀️ Proglib Academy
  • 🥱 1
Post #7575 1.32K
📍 Курс — это не только темы и домашние задания

Во многом его ценность определяет опыт тех, кто его разрабатывает и ведёт.

Об этом как раз новый пост Proglib Academy 🔥
Post #7574 1.61K
Оценка качества LLM — шпаргалка по метрикам и методам

Как понять что модель работает хорошо? Единой метрики нет — зависит от задачи.

📊 Автоматические метрики

🔤 Для генерации текста:

· BLEU — совпадение n-грамм с эталоном. Быстро, но плохо коррелирует с качеством

· ROUGE — полнота n-грамм. Чаще используется для суммаризации

· BERTScore — семантическое сходство через эмбеддинги. Лучше BLEU/ROUGE

· METEOR — учитывает синонимы и морфологию. Лучше для перевода


📐 Для RAG и QA:

· Faithfulness — насколько ответ соответствует контексту (не галлюцинирует)

· Answer Relevance — насколько ответ релевантен вопросу

· Context Recall — насколько полно использован контекст

· Context Precision — насколько точно выбраны релевантные куски

Инструменты: RAGAS, TruLens

🤖 LLM-as-Judge

Используете сильную модель (GPT-4, Claude) чтобы оценить ответ слабой.

Самый гибкий метод:
Оцени ответ по шкале 1-5:
· Точность (фактическая корректность)
· Полнота (покрытие вопроса)
· Релевантность (соответствие запросу)
· Стиль (читаемость и тон)

· Плюсы: гибко, понимает нюансы
· Минусы: дорого, bias к похожим на себя ответам, не детерминировано

👥 Human evaluation

· Попарное сравнение (A vs B) — надёжнее абсолютных оценок

· Оценка по чеклисту критериев

· Crowdsourcing через Toloka, MTurk

Золотой стандарт, но дорого и медленно.

🏆 Бенчмарки

· MMLU — знания по 57 областям

· HumanEval / EvalPlus — генерация кода

· MT-Bench — многоходовые диалоги

· HELM — комплексная оценка по многим задачам

· LiveBench — обновляется, минимизирует data contamination

Когда что использовать

· Разработка → автоматические метрики + LLM-as-Judge (быстро и дёшево)

· До продакшена → human evaluation на репрезентативном сете

· В продакшене → мониторинг через LLM-Judge + сбор user feedback

· Для публикации/сравнения → стандартные бенчмарки

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • 👍 6
  • ❤ 1
Post #7573 1.62K
🔧 Градиент, Якобиан, Гессиан: математика под каждой обучаемой моделью

Три слова которые выглядят пугающе. На деле — три способа измерить изменение.

📐 Градиент ∇f

Принимает скалярную функцию f : ℝⁿ → ℝ
Возвращает вектор частных производных первого порядка

Отвечает на вопрос: «В каком направлении f растёт быстрее всего?»

Именно поэтому градиент в центре оптимизации. Градиентный спуск идёт в противоположном направлении — потому что градиент указывает вверх по склону. Backpropagation — это эффективное вычисление градиентов во время обучения.


📊 Якобиан J_F

Принимает векторную функцию F : ℝⁿ → ℝᵐ
Возвращает матрицу m × n частных производных первого порядка

Отвечает на вопрос: «Как каждый выход меняется с каждым входом?»

Встречается в: анализе чувствительности, автодифференцировании, смене переменных.

Простая связь с AD:
— Forward-mode AD использует произведения Якобиан-вектор
— Reverse-mode AD (backprop) использует произведения вектор-Якобиан


📈 Гессиан H_f

Принимает скалярную функцию f : ℝⁿ → ℝ
Возвращает матрицу n × n частных производных второго порядка

Отвечает на вопрос: «Как меняется сам градиент?»

Гессиан измеряет кривизну. В критической точке:
— Гессиан положительно определён → локальный минимум
— Гессиан отрицательно определён → локальный максимум
— Гессиан неопределён → седловая точка


Чистая ментальная модель

Градиент = производные одного выхода → направление
Якобиан = производные многих выходов → чувствительность
Гессиан = производные второго порядка → кривизна

И простая связь: Гессиан — это Якобиан градиента.

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • 👍 10
  • 👏 1
Post #7571 1.57K
Machine Learning Systems — бесплатный учебник от Harvard

«Мир спешит строить AI-системы. Но не проектирует их.» — именно с этого начинается учебник.

ML Systems от Harvard — полный курс по инженерии AI-систем: от основ deep learning до распределённого обучения, оптимизации моделей и деплоя на реальном железе. В 2026 выйдет в MIT Press.


🔗 Ссылка на учебник

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • ❤ 3
  • 👍 2
Post #7570 1.03K

Forwarded from Proglib.academy | IT-курсы

🫡 Один и тот же запрос к AI можно выполнить двумя способами — и получить совершенно разный результат.

1️⃣ способ — просто попросить написать код. Модель может сгенерировать рабочее решение, но именно на этапе проверки часто всплывают пропущенные edge case’ы, ошибки обработки или проблемы с тестами.

2️⃣ способ — дать агенту цикл Think → Act → Observe. Он не останавливается после первой попытки: планирует действия, проверяет результат и, если находит ошибку, исправляет её и пробует снова.

Самое интересное, что разница здесь не столько в модели ❕ Claude, GPT или другая LLM могут быть одинаковыми. Разницу создаёт инженерная система вокруг них.

📅 Именно это разберём 23 июля в 19:00 (МСК) на бесплатном вебинаре с Алексеем Жиряковым (Executive Director в Сбере, GenAI Data Platform, ex-CTO Stream и KION).

На живом демо покажем, как один и тот же запрос работает без агентной системы и с ней 🔥

🔗 Регистрация

🏃‍♀️ Proglib Academy
Post #7569 1.54K
🔥 Курс «Разработка ИИ-агентов» стартовал, но вы еще успеваете присоединиться!

Мы только начали, а первый практический воркшоп пройдет только 23 июля. До этого времени вы спокойно успеете изучить материалы и нагнать группу.

💼 Главная фишка: финальный проект в портфолио:

В финальном проекте вы сможете выбрать один из двух вариантов: реализовать свою идею или решить задачу от партнера курса — крупной российской финтех-компании. Вы будете работать с датасетом, построенным по реальным сценариям, получите бизнес-контекст и продовые ограничения. В результате соберете AI-агента, который станет сильным проектом для портфолио.


🎁 Упомяните менеджеру специальное предложение «3 курса по цене 1»: Берете VIP-тариф — получаете курс «Разработка ИИ-агентов», хардкорный «AgentOps» и ещё один курс на выбор. Выгода 129.000 ₽!

Двери потока вот-вот закроются окончательно. Успейте забрать стек курсов и начать работу над реальным проектом

🔗 Занять место и забрать 3 курса
Post #7567 1.84K
👀 hfviewer: визуализация любой модели с Hugging Face

Вставляете название модели или ссылку с huggingface.co — получаете интерактивную визуализацию архитектуры. Работает с Qwen, Whisper и 2360+ моделями.

Можно фильтровать по типу задачи (text generation, embeddings, vision, audio) и организации. Удобно когда хочется быстро понять структуру незнакомой модели.

Ссылка на проект

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • ❤ 4
  • 👍 3
Post #7566 1.4K
😱 Что произошло в мире AI за неделю: дайджест для DS

Насыщенная неделя. Коротко о главном.

🚀 Модели

GPT-5.6 вышел в публичный доступ 9 июля. Параллельно вышли Grok 4.5 от xAI и первая платная модель от Meta.

Tencent выпустил Hy3 — 295B MoE-модель (21B активных параметров, контекст 256K) под Apache 2.0. Бесплатно на OpenRouter до 21 июля.

Cohere Labs выпустил Aya Vision — 8B мультимодальная модель на 23 языках, с фокусом на малопредставленные.

🔬 Исследования

OpenAI отозвал один из самых цитируемых бенчмарков по кодингу — оказался сломан. Хороший напоминание о том что бенчмаркам стоит доверять осторожно.

Исследователи из UPenn представили «Mollifier Layers» — техника интеграции функций сглаживания в нейросети для решения обратных дифференциальных уравнений. Применения: геномика, климатическое моделирование, материаловедение.

🛠 Инструменты

Anthropic запустил Claude Science — воркбенч для учёных в бета. Нативно рендерит 3D-структуры белков, геномные треки и химические структуры.

Claude Sonnet 5 — новая модель с сильным агентным поведением. По возможностям приближается к Opus 4.8.

📎 Источники

Дайджест недели — ODSC

Claude Science и Sonnet 5 — Radical Data Science

Mollifier Layers — Crescendo AI

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • 👍 2
  • ❤ 1
Post #7565 1.19K
🔥 Стартуем СЕГОДНЯ! Новый поток курса «Разработка ИИ-агентов» открыт

По этому поводу мы решили выложить закрытую запись одного из уроков из программы. Найти её в поиске YouTube нельзя — она доступна только по ссылке и всем, кто будет на курсе.

Внутри глубокий разбор LLM от Алексея Яндутова (Senior ML-инженер, развивал ответы «Алисы» и «Нейро» в Яндексе). Учимся получать точный результат без галлюцинаций.

Что внутри урока:

- Устройство LLM.
- Рабочие шаблоны промптов (Persona, Chain-of-Thought и др.).
- Разбор реального кейса Яндекса. Как автоматизировать разметку, обойти качество людей на 5% и срезать косты на 60%.


После просмотра вы поймете, когда хватает промпт-инжиниринга, а когда нужен RAG или fine-tuning.

👉Смотреть закрытый урок на YouTube

Понравился урок? Переходите на новый уровень! Оставляйте заявку на курс, чтобы научиться проектировать надежные автономные системы. Обучение началось, но вы еще успеваете присоединиться.

🔗 Занять место на курсе
Post #7564 1.34K
🚀 Уже завтра стартует новый поток курса «ИИ-агенты»!

Мы собрали мощнейший состав преподавателей. Учить вас проектировать архитектуру и собирать продакшн-агентов будут инженеры и исследователи из топовых IT-компаний.

Старт уже завтра!

Сомневаетесь, подойдет ли вам программа и подача? Начните с бесплатного демо-урока!

Всего за 2 часа вы заглянете под капот ИИ-агента, поймете, чем мышление модели отличается от ее ответа, и научите систему чинить собственный код. Это идеальный способ протестировать нашу платформу перед покупкой.

🔗 Пройти демо-урок и занять место на курсе
Post #7563 1.36K
🔤 Awesome Data Labeling: подборка инструментов для разметки данных

Репозиторий awesome-data-labeling собирает лучшие инструменты для разметки — текст, изображения, аудио, видео, временные ряды.

👍 Открытые и коммерческие, для одного человека и для команд.

Полезно когда нужно выбрать инструмент под конкретную задачу — не гуглить всё с нуля, а пройтись по кураторскому списку.

💡 Ссылка на список

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • ❤ 2
  • 👍 2
Post #7562 1.67K
Hidden_Markov_Models.pdf555.5 KB
📚 Hidden Markov Models: глава из главного учебника по NLP

Jurafsky & Martin «Speech and Language Processing» — один из лучших учебников по NLP.

Делимся главой про HMM — она хороша тем что объясняет полный набор алгоритмов в одном месте, включая то о чём часто умалчивают.

HMM строится на цепях Маркова: предсказываем следующее состояние только по текущему, история не важна. Звучит как ограничение — на деле мощный инструмент.

Три ключевых алгоритма:
— Viterbi — найти наиболее вероятную последовательность скрытых состояний (например, теги частей речи для слов)
— Forward algorithm — посчитать вероятность наблюдаемой последовательности
— Forward-Backward (Baum-Welch) — обучить HMM без размеченных данных. Это EM-алгоритм для последовательностей и главная причина почему HMM живут в задачах где разметки нет

🛠 HMM — базовая модель для временных рядов, NLP-задач без разметки, биоинформатики, распознавания речи. Понимание Forward-Backward даёт интуицию для более сложных моделей типа CRF и трансформеров.

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • 👍 4
  • ❤ 2
Post #7561 1.85K
yaml_basics.png438.5 KB
📌 YAML за 5 минут

Шпаргалка по YAML — ключи и типы данных, списки, вложенные объекты, отступы (это правда важно), многострочные строки, валидация через yamllint, частые ошибки линтера и реальные примеры из Docker Compose и Kubernetes.

Сохраняйте, пригодится 👇

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • ❤ 3
  • 👍 1
  • 😁 1
Post #7560 1.74K
Post #7559 1.45K
Чистка CSV-файлов с pandas: полный чеклист

Вот практический пайплайн который можно переиспользовать в любом проекте.


🔍 1. Инспекция до чистки


print(df.shape)
print(df.dtypes)
print(df.duplicated().sum())
df.isna().sum()


Сначала смотрим, потом чистим.

📋 2. Имена колонок


df.columns = (
df.columns
.str.strip()
.str.lower()
.str.replace(r"\s+", "_", regex=True)
)


🔲 3. Пустые строки и плейсхолдеры → NaN


df = df.replace(r"^\s*$", pd.NA, regex=True)
df = df.replace(["N/A", "n/a", "unknown", "not a date"], pd.NA)


🔤 4. Текстовые колонки


df["full_name"] = df["full_name"].str.strip().str.title()
df["email_address"] = df["email_address"].str.lower()
df["membership"] = df["membership"].str.lower()


5. Валидация категорий


allowed = {"bronze", "silver", "gold"}
df.loc[~df["membership"].isin(allowed), "membership"] = pd.NA


🔢 6. Числа и даты


df["age"] = pd.to_numeric(df["age"], errors="coerce")
df.loc[~df["age"].between(0, 120), "age"] = pd.NA

df["join_date"] = pd.to_datetime(df["join_date"], format="mixed", errors="coerce")

df["total_spend"] = (
df["total_spend"].astype("string")
.str.replace(r"[^0-9.-]", "", regex=True)
)
df["total_spend"] = pd.to_numeric(df["total_spend"], errors="coerce")


📧 7. Валидация email


pattern = r"^[^\s@]+@[^\s@]+\.[^\s@]+$"
df.loc[~df["email_address"].str.match(pattern, na=False), "email_address"] = pd.NA


🧩 8. Обработка пропусков


df = df.dropna(subset=["customer_id"]) # обязательное поле
df["age"] = df["age"].fillna(df["age"].median())
df["membership"] = df["membership"].fillna("unassigned")


🛡 9. Финальная валидация через assert


assert df["customer_id"].notna().all()
assert df["customer_id"].is_unique
assert df["age"].between(0, 120).all()
assert df["total_spend"].ge(0).all()


Если все проверки прошли — данные готовы к анализу.


📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • 🔥 8
  • 👍 3
Post #7558 1.38K
🔥 Не называйте любого продвинутого чат-бота «ИИ-агентом»!

Дмитрий Юдин, руководитель AI/ML-направления в Сloud․ru, наглядно разбирает уровни абстракции ИИ-продуктов и убирает путаницу в понятиях.

Что внутри видео:

- Почему ассистент и агент принципиально разные сущности;
- Как ассистент может быть просто «обёрткой» над LLM, а может скрывать под капотом сложнейшую мультиагентную систему;
- Как понимать архитектуру глубже, чтобы проектировать сильные решения.

Начните создавать агентные системы с нашего бесплатного демо-урока. Всего за 2 часа разберем внутреннее устройство агента, научим его чинить свой собственный код и сохранять контекст после перезапуска.

🔗 Забрать бесплатный демо-урок
  • ❤ 1
Post #7557 1.41K
LLM переводит pandas в Polars: что получается и где ошибается

Всё больше дата сайнтистов мигрируют с pandas на Polars через LLM: скормил скрипт, получил Polars, проверил что результат совпадает.

Команда Polars провела эксперимент — перевели 33 реальных запроса через Claude Opus и замерили качество.

31 из 33 переводов запустились и дали правильный результат. Это уже хорошо — год назад модели регулярно мешали pandas и Polars API и выдавали нерабочий код.

Большинство переводов читается как идиоматичный Polars. Но два паттерна остались.

⚠️ Паттерн 1: переводит структуру, а не намерение

Задача: добавить к каждой строке агрегат за 5-минутное окно. В pandas — resample + merge_asof. LLM перевёл точно так же:


# LLM переводит pandas-структуру
five_min = minute.group_by_dynamic("datetime", every="5m").agg(...)
result = minute.join_asof(five_min, on="datetime", strategy="backward")


Но в Polars для этого есть .over() — window function которая добавляет агрегат к каждой строке без промежуточного фрейма:


# Идиоматичный Polars
result = minute.with_columns(
pl.col("close").mean().over(pl.col("datetime").dt.truncate("5m")),
pl.col("volume").sum().over(pl.col("datetime").dt.truncate("5m")),
)


Одна операция вместо двух. Такой паттерн встретился в 3 из 33 случаев.


⚠️ Паттерн 2: извлекает скаляр в середине пайплайна


# LLM делает так — два прохода по данным
threshold = lf.select(pl.col("revenue").quantile(0.9)).collect().item()
result = lf.filter(pl.col("revenue") > threshold).collect()

# Идиоматичный Polars — один проход
result = lf.filter(
pl.col("revenue") > pl.col("revenue").quantile(0.9)
).collect()


.item() в середине пайплайна форсирует преждевременный collect() и разбивает оптимизацию запроса на два независимых шага.

Команда Polars упаковала правила в SKILL.md и загрузила в Claude Code. После этого:
— join-back паттерны: 3 → 1 случай
— mid-pipeline .item(): 1 → 0 случаев
— общий результат: 32/33 правильных

💡 Если мигрируете pandas → Polars через LLM — всегда проверяйте результат через polars.testing.assert_frame_equal. Код может работать и давать правильный ответ, но оставаться неидиоматичным и медленным. Особенно смотрите на join-back паттерны где .over() выразительнее и быстрее.

🔗 Ссылка на skill

📍 Навигация: ВакансииЗадачиСобесы

Библиотека дата-сайентиста

#буст
  • 👍 4
  • 🤩 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →