TGViewer
Channel Public Channel
Data Scientist | ML & AI

Data Scientist | ML & AI

@datascience_tg

Один из ведущих каналов по Data Science, Machine Learning и Big Data

Сотрудничество: @bape_ads
Прайс: @bape_media
Subscribers
3.05K
Photos
618
Videos
211
Links
697

Showing posts older than #820 · Back to latest

Older Posts 17 shown
Post #819 677
😨 Нейросеть уровня Claude Opus 4.6 теперь можно запускать у себя дома — энтузиасты дообучили Qwen 3.5 на данных Opus и выложили результат в открытый доступ

Получилась модель, которую можно запускать локально и использовать без ограничений.

Что по факту:
▶ Работает на одной GPU и подходит даже для домашнего железа

▶ Быстрый отклик и адекватное качество для повседневных задач

▶ Контекст до ~262k токенов, тянет большие тексты и код

▶ Умеет вести длинные цепочки рассуждений и работать автономно

▶ Стабильно взаимодействует с внешними API


Используем без подписок, без лимитов, полностью локально — забираем здесь.

tags: #полезное

➡ Data Scientist | Чат
Post #816 774
🗂 Гарвард открыл учебник по ML-системам — от autograd до продакшена

Не очередной курс «что такое нейронка» — здесь про то, как строить боевые ML-системы вокруг моделей.

Что внутри:
▶️ Сборка autograd, оптимизаторов, attention и мини-PyTorch с нуля;
▶️ Батчи, точность вычислений, архитектуры и тренировка;
▶️ Оптимизация производительности, ускорение на железе, бенчмаркинг.


Книгу и код можно читать бесплатно прямо сейчас.

⛓️ Ссылка на GitHub

tags:
#обучение #ml

➡ Data Scientist | Чат
  • ❤ 2
Post #815 727
💾 Claude Code бесплатно — появился мощный аналог OpenCode

По возможностям — действительно близко к Claude Code: два встроенных агента (build и plan), поддержка 70+ провайдеров (OpenAI, Anthropic, Google, Groq, локальные модели), полноценный TUI прямо в терминале.

Из интересного: можно подключить к GitHub Actions — и агент будет сам ревьюить PR, триажировать issues и коммитить правки по команде /oc в комментарии. Установка — одна строка в терминале.

⛓️ Ссылка на GitHub

tags: #полезное #claude

➡ Data Scientist | Чат
  • ❤ 1
Post #814 711
📰 Cursor выкатили Composer 2 — собственную модель уровня Claude Opus

Второе поколение in-house модели от Cursor. Заявляют, что дотягивается до Opus, но стоит заметно дешевле — $0.5/$2.5 за миллион токенов.

Нюанс: по умолчанию пользователи получают fast-версию по цене $1.5/$7.5 за миллион токенов. Разница тройная — стоит держать в голове при оценке реальных расходов. Также доступна по подписке.

tags: #новости

➡ Data Scientist | Чат
Post #813 783
💾 TensorTonic — платформа с 200+ алгоритмами и задачами для ML-щиков

Что внутри:
▶️ Разборы исследований и пошаговое воспроизведение архитектур моделей;
▶️ Объяснение тем и концепций с интерактивными визуализациями;
▶️ Система прогресса и достижений — куда же без геймификации.


Отличный вариант вечером качнуть скиллы в ML ☕️

tags: #полезное #ml

➡ Data Scientist | Чат
  • ❤ 1
Post #808 665
💾 Шпаргалка по архитектурам LLM: от GPT-2 до триллионников

LLM Architecture Gallery — страница с карточками на 39 моделей (2019–2026): DeepSeek, Qwen, Llama, Kimi, Grok, Nemotron и другие.Для каждой — диаграмма архитектуры, тип декодера (dense / sparse MoE / hybrid), тип attention и ссылки на техрепорты и конфиги с HuggingFace.

Хорошо видно, как рынок сошёлся на MoE + MLA для больших моделей и почему гибридные архитектуры (Mamba-2, DeltaNet, Lightning Attention) набирают ход.

⛓️ Открыть галерею

tags: #полезное #llm

➡ Data Scientist | Чат
Post #806 761
🔖 Машинное обучение без воды — один учебник, вся математика

Огромный том, в котором собран весь фундамент ML: чистая теория, алгоритмы и математика без лишних слов. Идеально, если хотите глубоко понять, как всё работает.

Внутри:
— Анализ, линал и тервер для прочного фундамента;
— Оптимизация — от SGD до проксимальных методов;
— Линейные модели, SVM, деревья, бустинг, нейросети;
— Генеративка: MCMC, вариационные подходы, графовые модели, GAN;
— PCA, кластеризация, факторный анализ, обучение на многообразиях;
— Теория обобщающей способности моделей и неравенства концентрации.


Ссылка на учебник — здесь.

tags: #полезное

➡ Data Scientist | Чат
Post #805 795
✏️ SQL для Data Science за 6 недель

Опытный дата-сайентист собрал пошаговый план изучения SQL, оформив его в репозиторий на GitHub. Каждую неделю — новая тема с полезными материалами и практикой.

Программа выглядит так:
▶️ Неделя 1 — основы SQL и извлечение данных;
▶️ Неделя 2 — группировка с помощью GROUP BY;
▶️ Неделя 3 — все типы JOIN и где их применять;
▶️ Неделя 4 — разбор оконных функций;
▶️ Неделя 5 — CTE и подзапросы;
▶️ Неделя 6 — финальный проект для закрепления.


Отличный старт для тех, кто хочет подтянуть SQL именно под задачи аналитики и Data Science.

➡ Ссылка на курс

tags: #курс

➡️ Data Scientist | Чат
  • 🔥 1
Post #799 819
🗂 Шпаргалка по нейросетям

В ней наглядно представлены все основные типы Neural Network, с краткой теорией и полезными советами по Python для работы с данными и машинным обучением.

По сути, это компиляция разных шпаргалок в одном удобном документе.

➡ Ссылка на шпаргалку

tags: #полезное

➡ Data Scientist | Чат
  • ❤ 1
Post #798 721
Фундаментальный закон

➡ Data Scientist | #memes
  • 🤣 8
Post #796 924
🛫 ML Roadmap 2026 — большая карта для входа в ML, LLM и MLOps

На GitHub завирусился довольно толковый roadmap по ML: внутри автор собрал путь от базы по математике, NumPy и Pandas до LLM, agentic RAG, fine-tuning, MLOps и подготовки к интервью. В репозитории действительно есть блоки про Karpathy, MCP, RLHF, LoRA/PEFT и системный дизайн для AI-собесов.

Удобно, что это не просто список ссылок «на всё подряд», а именно маршрут по темам:
▶️ База и инструменты;
▶️ Классический ML;
▶️ LLM и агенты;
▶️ Инженерия и MLOps;
▶️ Подготовка к интервью.


➡️ Ссылка на GitHub

tags: #ml #llm

➡ Data Scientist | Чат
  • ❤ 3
  • 🔥 2
Post #795 620
📰 Google представили новую Gemini Embedding — модель с мультимодальными эмбеддингами

Теперь она умеет нативно превращать в эмбеддинги не только текст, но и другие типы данных: до 120 секунд видео, PDF до 6 страниц, аудио.

Эмбеддинги сделаны по принципу «матрёшки» — часть вектора можно использовать как отдельный эмбеддинг. Он будет менее точным, но всё равно пригодным для поиска и RAG.

По ценам:
🔸 Текст — около $0.2 за миллион токенов;
🔸 Мультимодальность заметно дороже;
🔸 Видео может доходить до ~$12 за миллион токенов (≈15k кадров).


Интересно, что у конкурентов в этой области пока мало движения — например, OpenAI последний раз обновляли embedding-модели ещё в январе 2024.

tags: #новости

➡ Data Scientist | Чат
  • 🔥 1
Post #794 732
🗂 Собираем свой мини-Skynet — подборка из 10 мощных репозиториев по ИИ от бигтехов

1. Generative AI for Beginners и AI Agents for Beginners
Microsoft подробно разбирают генеративный ИИ и архитектуру агентов: от теории до практики.


2. LLMs from Scratch
Пошаговая сборка собственного GPT, чтобы понять, как устроены LLM «под капотом».


3. OpenAI Cookbook
Официальный набор примеров по работе с API, RAG-системами и интеграцией ИИ в продакшен от OpenAI.


4. Segment Anything и Stable Diffusion
Классические инструменты computer vision и генерации изображений от Meta и исследовательской команды CompVis.


5. Python 100 Days и Python Data Science Handbook
Мощная база по Python и анализу данных.


6. LLM App Templates и ML for Beginners
Готовые шаблоны приложений с LLM и структурированный курс по классическому машинному обучению.


Если хотите глубоко разобраться в AI или начать строить собственные проекты — отличный стартовый набор.

tags: #github #полезное

➡ Data Scientist | Чат
Post #793 812
🗂 Свежий курс по deep learning от MIT теперь в открытом доступе

На сайте вуза опубликовали полноценный учебный курс: 24 лекции, практические задания, домашние работы и подборку материалов для самостоятельного изучения.

В программе — современные нейросетевые архитектуры, генеративные модели, трансформеры, инференс и другие ключевые темы.

➡ Ссылка на курс

tags: #курс

➡ Data Scientist | Чат
Post #792 757
🗂 Нашли интересную платформу — что-то вроде аналога LeetCode для Data Science

DataLemur — платформа с реальными задачами из собеседований в Tesla, Meta, Twitter и других топовых компаниях.

Внутри задачи по SQL, статистике, Python и ML, которые можно фильтровать по уровню сложности и компаниям, чтобы прокачиваться точечно.

➡ Ссылка на платформу

tags: #статья

➡ Data Scientist | Чат
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →