TGViewer
Channel Public Channel
Data Scientist | ML & AI

Data Scientist | ML & AI

@datascience_tg

Один из ведущих каналов по Data Science, Machine Learning и Big Data

Сотрудничество: @bape_ads
Прайс: @bape_media
Subscribers
3.05K
Photos
616
Videos
211
Links
695

Showing posts older than #973 · Back to latest

Older Posts 18 shown
Post #972 662
🔖 Вышла интерактивная карта всех работ с ICML 2026

Если не знаете, с чего начать изучение материалов одной из главных ML-конференций года — вот отличный вариант.

Можно исследовать статьи по тематикам, открывать краткие описания, переходить к полным версиям и сохранять интересные материалы в свою коллекцию.

⛓️ Смотрим здесь

tags: #полезное

Data Scientist | Чат
  • 🔥 3
  • ❤ 1
  • 👍 1
Post #971 599
🔖 Ошибка при выборе AI-железа

Вопрос не в том, «потянет ли видеокарта модель», а в том, что станет узким местом после загрузки.

Рынок сейчас:
• NVIDIA — максимум bandwidth
• Apple — максимум памяти
• Strix Halo — интересный x86 с unified memory
• Tenstorrent — open-source стек


Но после загрузки модели начинают решать KV-cache, декодирование, батчинг и качество софта.

Локальный AI сегодня — это не про гигабайты памяти. Это про баланс памяти, скорости и программного стека.

⛓️ Ссылка на источник

tags: #полезное

Data Scientist | Чат
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #970 587
🔖 AI, который читает Reddit и Hacker News за вас

Проект собирает контент из крупнейших технологических площадок, анализирует его через AI, убирает дубли и формирует компактную сводку с самым важным.

Один инфоповод — одна запись. Без повторов, шума и бесконечного скроллинга.

⛓️ Ссылка на GitHub

tags: #полезное

Data Scientist | Чат
  • ❤ 2
  • 👍 1
  • 🔥 1
Post #969 681
📰 Baidu выложила в опенсорс Unlimited-OCR

Новая OCR-модель умеет обрабатывать сотни страниц за один запуск и при этом сохраняет контекст даже на очень больших PDF-документах.

При размере всего 3B параметров она показывает 93% на OmniDocBench, обгоняет DeepSeek-OCR и сохраняет стабильную производительность даже при обработке сотен страниц за один проход.

⛓️ Ссылка на GitHub

tags: #новости

Data Scientist | Чат
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #968 661
🔖 Собираем собственную GPT-подобную модель на PyTorch

Нашли отличный репозиторий для тех, кто хочет понять, как устроены современные LLM под капотом.

Внутри — 10 Jupyter-ноутбуков с пошаговыми объяснениями и реализацией ключевых компонентов языковых моделей.

⛓️ Ссылка на GitHub

tags: #полезное

Data Scientist | Чат
  • 🔥 2
  • ❤ 1
  • 👍 1
Post #967 661
🔖 Гайд по Codex 5.5, который поможет получать результаты лучше

Многие жалуются, что Codex стал работать хуже. Но проблема не всегда в модели.

Несколько советов:
— Декомпозируйте задачи через /goals;
— Используйте Krypton для расширения возможностей агента;
— Планируйте на XHigh, кодируйте на High;
— Не забывайте про Browser Use и Computer Use.


Дополнительно стоит подключить GitHub-репозиторий и использовать Pro-модель для ревью, тестирования и проектирования решений.

⛓️ Ссылка на дополнительный скилл

tags: #полезное

Data Scientist | Чат
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #965 681
🔖 11 бесплатных книг по AI и Machine Learning

Сохраняйте подборку книг от MIT и ведущих исследователей, которые помогут прокачаться в ML, Deep Learning и AI Systems.

1. Foundations of Machine Learning
2. Understanding Deep Learning
3. Introduction to Machine Learning Systems
Vol 1
Vol 2
4. Algorithms for ML
5. Deep Learning
6. Reinforcement Learning
7. Distributional Reinforcement Learning
8. Multi Agent Reinforcement Learning
9. Agents in the Long Game of AI
10. Fairness and Machine Learning
11. Probabilistic Machine Learning
Part 1
Part 2


tags: #полезное

Data Scientist | Чат
  • 🔥 3
  • ❤ 2
  • 👍 2
Post #964 746
📰 Вышла опенсорс-модель для извлечения данных из документов

Datalab открыли доступ к Lift — 9B-модели, заточенной под обработку PDF-файлов и изображений.

Что умеет:
— Извлекает структурированные данные в формате JSON;
— Показывает 90,2% точности — почти на уровне Gemini 3.5 Flash (91,3%);
— Обходит популярные open-source решения вроде NuExtract3;
— Обрабатывает документы в среднем всего за 9,5 секунды.


⛓️ Hugging Face тут, GitHub здесь

tags: #новости

Data Scientist | Чат
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #963 673
🔖 Джек Дорси передал своего AI-агента Goose в Linux Foundation

Goose — это не просто очередной кодогенератор, а полноценный агент для разработки.

Самое интересное — Goose может использовать Claude Code и Codex как субагентов, распределяя между ними задачи.

У проекта уже 46 000+ звёзд на GitHub и сотни контрибьюторов. Похоже, экосистема агентной разработки становится всё серьёзнее.

⛓️ Ссылка на GitHub

tags: #полезное

Data Scientist | Чат
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #962 637
🔖 Нашли агентный фреймворк, который учится на своих ошибках

Большинство AI-агентов используют статические навыки: написал один раз — и надеешься, что они всегда будут работать.

Memento-Skills идёт другим путём. Если навык не справляется с задачей, система сама анализирует ошибку, переписывает проблемный скилл и сохраняет улучшенную версию в библиотеку.

⛓️ Ссылка на GitHub

tags: #полезное

Data Scientist | Чат
  • ❤ 2
  • 👍 1
  • 🔥 1
Post #960 677
🔖 Как масштабировать модели и понимать GPU

Google опубликовали две бесплатные книги для ML-инженеров:
How to Scale Your Model;
How to Think About GPUs.

Материалы объясняют, что происходит под капотом современных AI-систем и почему одни модели обучаются неделями, а другие — часами.

tags: #полезное

Data Scientist | Чат
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #958 760
🔖 Шпаргалки по Transformers и LLM от Stanford

Нашли отличный набор материалов из курса Stanford CME-295 по большим языковым моделям.

Охватывают токенизацию, механизм самовнимания, prompting, дообучение, LLM-as-a-judge, RAG, AI-агентов и модели рассуждений.

⛓️ Забираем здесь

tags: #полезное

Data Scientist | Чат
  • ❤ 2
  • 👍 1
  • 🔥 1
Post #957 708
🔖 Нашли скилл, который отучает ИИ писать лишний код

Ponytail заставляет Claude Code, Codex и других агентов сначала подумать, а уже потом кодить.

По словам автора, на простых задачах агенты писали на 80–94% меньше кода, работали в несколько раз быстрее и заметно экономили токены.

⛓️ Ссылка на GitHub

tags: #полезное

Data Scientist | Чат
  • ❤ 1
  • 👍 1
  • 🔥 1
Post #956 701
🔖 Google фактически стандартизировали LLM-вики

Компания представила Open Knowledge Format (OKF) — простой формат хранения знаний для AI-агентов и LLM.

По сути, это обычные markdown-файлы, которые можно хранить в Git-репозитории, переносить между сервисами и использовать без специальных инструментов.

⛓️ Подробнее здесь

tags: #полезное

Data Scientist | Чат
  • 👍 2
  • ❤ 1
  • 🔥 1
Post #955 706
9 популярных мер расстояния в Data Science и Machine Learning

Data Scientist | Чат
  • ❤ 6
  • 👍 1
  • 🔥 1
Post #954 800
🔖 Изучаем Deep Learning на практике

Нашли мощный бесплатный курс, который поможет погрузиться в мир нейросетей без тонны скучной теории.

Вас ждут реальные проекты, работа с PyTorch, FastAI и Hugging Face, а также задачи по компьютерному зрению, NLP и анализу данных.

⛓️ Ссылка на GitHub

tags: #полезное

Data Scientist | Чат
  • ❤ 3
Post #953 711
📰 Вышла Kimi-K2.7-Code — новая open-source модель для агентных задач

По опубликованным бенчмаркам она конкурирует с GPT-5.5 и Claude Opus 4.8, а заодно обещает более экономное использование токенов.

Для тех, кто строит агентные системы и автоматизирует разработку — точно стоит посмотреть.

⛓️ Код на Hugging Face или запускать через Kimi Code

tags: #новости

Data Scientist | Чат
  • ❤ 3
  • 👍 1
  • 🔥 1
Post #952 808
🔖 Большая коллекция AI-проектов для практики

Нашли репозиторий, который поможет перейти от теории к реальной разработке AI-приложений.

Внутри десятки готовых проектов: AI-аналитики, RAG-системы, OCR-приложения, агенты для ревью кода, помощники для путешествий и многое другое.

⛓️ Ссылка на GitHub

tags: #полезное

Data Scientist | Чат
  • ❤ 2
  • 👍 1
  • 🔥 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →