Последняя часть про масштабирование и ограничения
Большая часть данных для обучения - это рандомные тексты в интрнете. И уже сейчас топовые нейронки могут сами создавать данные лучшего качества. То есть будет больше пользы, если мы вместо обучения на некачественных данных с какого то момента будем переводить модель на самообучение. Просто оставить ее поразмышлять саму с собой.
Если качественных данных всегда мало, давайте попросим одну модель обучать другую. В итоге инференс в дата центрах будет работать на создание синтетических данных. То есть фактически данные напрямую зависят от вычислительных мощностей.
Напомню, в первой части поста мы хотели юзать данные, чтобы убежать от экспоненциального роста требований к компьюту. А пришли к тому, что данные это тоже компьют. Звучит как потрясающе важная задача поиска оптимума. В какой момент синтетические данные будут приносить достаточно пользы, чтобы сжатие информации в более компактную модель экономило больше, чем мы тратим на создание этих данных? Вот тут Марк говорит про это: https://youtu.be/HLC4P28UYSM
Еще интересно, какое соотношение должно быть у пре-трейнинга и файнтюнинга? Йон считает, что файнтюнинг важен и недооценен. Мы пока втупую растим обьемы данных для обучения и контекстное окно. Год назад размер окна был 8к токенов, сейчас уже 128к у GPT-4o, 200 у Claude 3 и сколько то миллионов у какой то из Gemini. А файнтюнинг по мнению Йона круто дополняет и то и то.
Например, можно попробовать научить модель лучше понимать, когда ей недостаточно данных для ответа и просить больше контекста. Это оч нужно в решении сложных задач. Обычно чем дольше человек сфокусирован на конкретной задаче, тем больше он про нее узнает. Учится и с вложеным временем повышет шансы на успех. Нейронки пока так не могут, тк есть проблема галлюцинаций. Если модель не знает ответа, она пробует его придумать, ведь единственная альтернатива - это сдаться. Но можно дать ей еще один выход в виде онлайн обучения, как у человека.
В общем, в скейлинге моделей назревают интересные проблемы и будет супер интересно наблюдать как их будут решать.
#ai
Post #31
299