TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5497 3.25K
Данные для обучения ИИ в 2026

Идея «интернет как бесконечный датасет» больше не работает. Графики по StackExchange и Stack Overflow выглядят тревожно: поток новых вопросов рос до середины 2010-х, потом застыл, а после 2022–2023 начал резко падать. А ведь именно Q&A-площадки были идеальным топливом для LLM: вопрос → контекст → решение → обсуждение → правки.

Давай разберёмся, на чём нейросети будут учиться в 2026-м и где данные всё ещё тащат, а где quietly превращаются в проблему.

Где данные всё ещё — это win

• Очищенный веб вместо «сырого интернета»
CommonCrawl никуда не делся, но в обучение идут уже не сырые скрейпы, а сильно отфильтрованные корпуса. Примеры вроде FineWeb и FineWeb-Edu на Hugging Face показывают новый стандарт: меньше объёма, больше смысла, жёсткая дедупликация и фильтрация AI-мусора.

• Код и инженерные следы
Даже если вопросов становится меньше, разработчики продолжают писать код. Репозитории, PR, issue-дискуссии, changelog’и и migration-гайды — стабильный источник свежего прикладного знания, особенно для reasoning и tool-use.

• Книги и архивы public domain
Происходит тихий разворот к «старым» источникам. Они качественнее случайного веба и юридически безопаснее. Например, корпус public-domain книг от Harvard University — это почти учебник для будущих моделей.

• Логи взаимодействий с продуктами
Диалоги пользователей с ассистентами, оценки «полезно / не полезно», исправления — золото для instruction-tuning и RL. Именно здесь появляется знание о том, как моделью реально пользуются.

Где начинаются выстрелы в ногу

• Исчезновение бесплатных Q&A
Знания уходят в закрытые чаты, корпоративные базы, Slack и Discord. Публичный слой интернета беднеет, а модели теряют источник «живых» инженерных кейсов.

• AI-засорение веба
Самоповторы, SEO-копипаст и синтетика поверх синтетики. Без жёсткой фильтрации это прямой путь к деградации качества.

• Синтетические данные без тормозов
Синтетика дёшева и удобна, но перекорм приводит к замыканию на собственных ошибках и стилю «копия копии». Рабочие пайплайны держатся только на смеси: реальное + синтетика + фильтры.

• Юридические риски
Компании всё меньше готовы «скрейпить и разбираться потом». Лицензирование и партнёрства становятся нормой — как у OpenAI с Stack Overflow.

Что отличает устойчивые датасеты будущего


— Курирование вместо гонки за объёмом
— Model-based filtering и дедупликация
— Чёткое происхождение данных
— Смесь источников, а не ставка на один
— Версионирование и воспроизводимость


Будущее обучения ИИ — это меньше данных, но больше инженерии вокруг них. И если раньше узким местом были модели, то в 2026-м им станет именно качество и происхождение датасетов.

Data Science
  • 👍 12
  • ❤ 4
More from @devsp
  1. Sep 30, 2026Две ИИ-фабрики в Армении: что там отгрохали и на кого это в итоге пашет В августе в Раздан…
  2. Sep 30, 2026Из Москвы в Миннеаполис — с тремя решениями для улучшения персонализации в рекомендательны…
  3. Sep 30, 2026Про Ember-1 сейчас гудят на Hacker News. Исследователи дообучили Kimi K3 так, что рассужда…
  4. Sep 30, 2026Локальный ассистент для зумов, часть 8: модель, из-за которой я перекроил диаризацию за од…
  5. Sep 29, 2026Путь к ИИ-сингулярности В багажнике у нас: пара репо с вайб-кодом, который ни один тест не…
  6. Sep 29, 2026Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком Автор в одино…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →