TGViewer
Трагедия общин 🤌 Трагедия общин 🤌 @commonstragedy · 652 subscribers
Post #31 299
Последняя часть про масштабирование и ограничения

Большая часть данных для обучения - это рандомные тексты в интрнете. И уже сейчас топовые нейронки могут сами создавать данные лучшего качества. То есть будет больше пользы, если мы вместо обучения на некачественных данных с какого то момента будем переводить модель на самообучение. Просто оставить ее поразмышлять саму с собой.

Если качественных данных всегда мало, давайте попросим одну модель обучать другую. В итоге инференс в дата центрах будет работать на создание синтетических данных. То есть фактически данные напрямую зависят от вычислительных мощностей.

Напомню, в первой части поста мы хотели юзать данные, чтобы убежать от экспоненциального роста требований к компьюту. А пришли к тому, что данные это тоже компьют. Звучит как потрясающе важная задача поиска оптимума. В какой момент синтетические данные будут приносить достаточно пользы, чтобы сжатие информации в более компактную модель экономило больше, чем мы тратим на создание этих данных? Вот тут Марк говорит про это: https://youtu.be/HLC4P28UYSM

Еще интересно, какое соотношение должно быть у пре-трейнинга и файнтюнинга? Йон считает, что файнтюнинг важен и недооценен. Мы пока втупую растим обьемы данных для обучения и контекстное окно. Год назад размер окна был 8к токенов, сейчас уже 128к у GPT-4o, 200 у Claude 3 и сколько то миллионов у какой то из Gemini. А файнтюнинг по мнению Йона круто дополняет и то и то.

Например, можно попробовать научить модель лучше понимать, когда ей недостаточно данных для ответа и просить больше контекста. Это оч нужно в решении сложных задач. Обычно чем дольше человек сфокусирован на конкретной задаче, тем больше он про нее узнает. Учится и с вложеным временем повышет шансы на успех. Нейронки пока так не могут, тк есть проблема галлюцинаций. Если модель не знает ответа, она пробует его придумать, ведь единственная альтернатива - это сдаться. Но можно дать ей еще один выход в виде онлайн обучения, как у человека.

В общем, в скейлинге моделей назревают интересные проблемы и будет супер интересно наблюдать как их будут решать.

#ai
More from @commonstragedy
  1. Sep 10, 20263. Это снова поднимает кучу вопросов о том как мы обучаем модели. В какой то момент место…
  2. Sep 10, 20262. Наличие системы оценки пушит к тому чтобы читерить Дальше случился другой факап с уже д…
  3. Sep 10, 2026Про скользкую дорожку Есть такой популярный аргумент, что нейросети это просто инструмент.…
  4. Aug 27, 2026Про диктовку голосом Потихоньку переучиваюсь наговаривать текст голосом, а не печатать на…
  5. Apr 14, 2026И чо? (последняя часть) Короче, индустрия не готова к росту от агентов. Потому что он случ…
  6. Apr 14, 20261. Больше всех железа у Google 2. На 2025 мы тратим 13 гигават энергии на вычисления 3. AS…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →