Продолжение поста выше про масштабирование и ограничения у ИИ.
Один из выходов - использовать как можно больше качественных данных. Чем круче данные, тем меньшего размера модель нужна.
ЛЛМки это машины по сжатию информации; они перепаковывают десятки терабайт из интернета в веса модели на сотни гигабайт. ИИ лабы уже давно экспирементируют с мелкими модельками, чтобы понять насколько это важно. Например, Phi-3 тренировали на ответах GPT-4, она переняла большую часть знаний большой модели, но по размеру она в 1000 раз меньше! Так что основной вывод из эксперимента - качество данных решает.
Но не все так просто. Недавно послушал интервью с John Schulman, это кофаундер OpenAI и замена ушедшим Sutskever и Leike. Крутой чел, короче. В подкасте он интересную мысль закинул: сколько бы данных ты не собрал - всегда будет меньше, чем хочется. Качественных данных не хватает не потому что их мало, а потому что экспоненциальный рост требует еще больше.
Мы пока не уперлись в стену, но Йон считает, что акцент сместится на данные для дообучения - того, что мы используем для файнтюнинга (меняем веса малым количеством данных) и in-context learning (это то что в промпте и не меняет веса). До повышения Йон как раз этим в OpenAI и занимался. И вполне успешно.
Если посмотреть, насколько GPT-4 прокачалась с момента релиза в прошлом году - разница примерно в 100 Elo, что весьма много. И все благодаря дообучению, тк базовая модель оставлась той же. Вообще, различия между топовыми моделями GPT-4o, Claude 3, Llama3, Gemini 1.5 по большей части это тоже пост-обучение. И как то так сложилось, что мы больше внимания уделяем не этому, а данным для пре-трейнинга.
#ai
Post #30
438