TGViewer
Трагедия общин 🤌 Трагедия общин 🤌 @commonstragedy · 652 subscribers
Post #30 438
Продолжение поста выше про масштабирование и ограничения у ИИ.

Один из выходов - использовать как можно больше качественных данных. Чем круче данные, тем меньшего размера модель нужна.

ЛЛМки это машины по сжатию информации; они перепаковывают десятки терабайт из интернета в веса модели на сотни гигабайт. ИИ лабы уже давно экспирементируют с мелкими модельками, чтобы понять насколько это важно. Например, Phi-3 тренировали на ответах GPT-4, она переняла большую часть знаний большой модели, но по размеру она в 1000 раз меньше! Так что основной вывод из эксперимента - качество данных решает.

Но не все так просто. Недавно послушал интервью с John Schulman, это кофаундер OpenAI и замена ушедшим Sutskever и Leike. Крутой чел, короче. В подкасте он интересную мысль закинул: сколько бы данных ты не собрал - всегда будет меньше, чем хочется. Качественных данных не хватает не потому что их мало, а потому что экспоненциальный рост требует еще больше.

Мы пока не уперлись в стену, но Йон считает, что акцент сместится на данные для дообучения - того, что мы используем для файнтюнинга (меняем веса малым количеством данных) и in-context learning (это то что в промпте и не меняет веса). До повышения Йон как раз этим в OpenAI и занимался. И вполне успешно.

Если посмотреть, насколько GPT-4 прокачалась с момента релиза в прошлом году - разница примерно в 100 Elo, что весьма много. И все благодаря дообучению, тк базовая модель оставлась той же. Вообще, различия между топовыми моделями GPT-4o, Claude 3, Llama3, Gemini 1.5 по большей части это тоже пост-обучение. И как то так сложилось, что мы больше внимания уделяем не этому, а данным для пре-трейнинга.

#ai
More from @commonstragedy
  1. Sep 10, 20263. Это снова поднимает кучу вопросов о том как мы обучаем модели. В какой то момент место…
  2. Sep 10, 20262. Наличие системы оценки пушит к тому чтобы читерить Дальше случился другой факап с уже д…
  3. Sep 10, 2026Про скользкую дорожку Есть такой популярный аргумент, что нейросети это просто инструмент.…
  4. Aug 27, 2026Про диктовку голосом Потихоньку переучиваюсь наговаривать текст голосом, а не печатать на…
  5. Apr 14, 2026И чо? (последняя часть) Короче, индустрия не готова к росту от агентов. Потому что он случ…
  6. Apr 14, 20261. Больше всех железа у Google 2. На 2025 мы тратим 13 гигават энергии на вычисления 3. AS…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →