Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @tproger_sales_bot
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Post #7660
499
БИ @dsproglib

— попробовать LoRA/QLoRA;
— адаптировать модель под свой формат данных;
— собрать небольшой synthetic dataset;
— разобраться с процессом дообучения LLM.
— predictive coding;
— локальные ошибки;
— множители Лагранжа;
— PI-регуляция.


🔘 MoE-модель на 552B параметров;
🔘 8B–16B активных параметров на токен;
🔘 FP8/FP4-квантизация;
🔘 контекст до 1 млн токенов;
🔘 поддержка изображений, инструментов и reasoning;
🔘 запуск через SGLang.


✳️ делаем много бутстрап-выборок
✳️ обучаем модели параллельно
✳️ объединяем результаты (среднее/голосование)
✳️ RandomForestClassifier
✳️ RandomForestRegressor
✳️ BaggingClassifier
✳️ BaggingRegressor
✳️ задаём базового слабого ученика
✳️ увеличиваем вес «трудных» объектов
✳️ комбинируем множество слабых моделей в одну сильную
✳️ GradientBoosting
✳️ XGBoost
✳️ CatBoost
✳️ LightGBM
✳️ AdaBoost
Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?

python machine learning
TF — насколько часто термин встречается в документе;
IDF — насколько термин редкий во всей коллекции;
длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.
score =
TF × IDF × поправка на длину документа


— Поддержка мультимодальных данных: изображения, видео, документы
— Инкрементальное хранение и трансформация данных
— Простая декларативная работа вместо множества систем
pip install pixeltable
scaler.fit_transform(X) # уже увидел весь датасет
X_train, X_test = train_test_split(X)
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
model = make_pipeline(
StandardScaler(),
LogisticRegression()
)
model.fit(X_train, y_train)
score = model.score(X_test, y_test)



model.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning”— оптимизацию и линейную алгебру
— графические модели
— Variational Inference
— Monte-Carlo методы