TGViewer
Industrial Ai | Stanislav Dmitriyev Industrial Ai | Stanislav Dmitriyev @stas_dmitriyev · 257 subscribers
Post #183 79

Forwarded from Анализ данных (Data analysis)

⚡️ Андрей Карпаты высказал про дизайн ИИ-моделей мысль, которую большинство упускает из виду.

Его тезис: передовые модели не потому огромные, что технология сложная, а потому что данные для обучения мусорные.

Когда обычный человек думает про интернет, ему в голову приходят статьи Wall Street Journal, Википедия, серьёзные тексты.

Так вот, датасет для предобучения выглядит иначе. Если открыть случайные документы из реального корпуса, то там будут тикеры акций, битый HTML, спам и бессвязный текст.
По одной из оценок, Llama 3 сжимает информацию со скоростью всего 0.07 бита на токен. То есть модель помнит большую часть обучающих данных смутно.

Поэтому мы и строим модели на триллион параметров не потому, что нам нужен мозг такого размера, а потому что нужен движок сжатия такого масштаба, чтобы выжать хоть какой-то интеллект из потока шума. Большая часть параметров работает памятью, а не мышлением.

Предложение Карпаты - разделить эти две функции. Построить когнитивное ядро - модель, в которой остались только алгоритмы рассуждения и решения задач, без энциклопедического заучивания.

А рядом поставить внешнюю память, к которой модель обращается за фактами.

По его прогнозу, когнитивное ядро, обученное на качественных данных, способно выйти на настоящий интеллект при размере около миллиарда параметров. Для сравнения: флагманские модели сегодня крутятся в диапазоне от 200 миллиардов до 1.8 триллиона параметров, и большая часть этого веса уходит на запоминание интернет-помойки.

GPT-4o работает примерно на 200 миллиардах параметров и обходит оригинальный GPT-4 на 1.8 триллиона. Стоимость инференса на уровне GPT-3.5 с 2022 по 2024 упала в 280 раз, и почти весь этот выигрыш дали модели меньшего размера, обученные на более чистых данных с более продуманной архитектурой.

Настоящим узким местом ИИ сейчас является качество данных.

@data_analysis_ml
  • 🔥 2
  • 😁 1
More from @stas_dmitriyev
  1. Oct 3, 2026🔍 Американский бизнес распробовал открытые модели ИИ Интересная статья Financial Times: к…
  2. Oct 3, 2026🔍 Anthropic вкладывает $100 млн в подготовку 10 000 инженеров по внедрению ИИ Компания за…
  3. Oct 3, 2026🔍 Цифровые двойники — минимум на 60% крупных промышленных предприятий Казахстана к 2029 г…
  4. Oct 2, 2026🔍 Большой консалтинг. Большие планы на ИИ. Посмотрел, как McKinsey, BCG, Bain, EY, KPMG и…
  5. Oct 2, 2026🔍 ИИ в геологоразведке, похоже, быстро развивается. Свежий обзор в Minerals собрал 91 исс…
  6. Oct 2, 2026🔍 Научная статья: как научить ИИ различать породы по нескольким примерам. Авторы GeoProto…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →