Интернет оказался слишком
мал для обучения AI
Разработчики столкнулись с проблемой нехватки данных для обучения новых моделей, включая долгожданную GPT-5!
Авторское право ужесточается, некоторые ресурсы блокируют доступ к своим данным, а попытки обучать AI на материалах других моделей и синтетическом контенте могут привести к проблемам.
Поиск альтернатив
Мы уже писали о том, что OpenAI прибегает к транскрипции роликов на YouTube. Возможно, они используют эти данные для обучения GPT-5, однако большинство данных в интернете непригодны для обучения из-за бессвязного текста, а мы уже знаем, как LLM важен контекст.
DatologyAI предложил метод "учебного плана", согласно котороve данные «скармливаются» моделям в определённом порядке, помогающем установить связь между ними. Этот подход позволяет достигать сопоставимых успехов в обучении AI при меньшем объеме данных.
Как думаете, сколько времени займет решение такой серьезной проблемы?
#AI
Post #2474
1.6K

- ❤🔥 13
- 🔥 5
- 👏 3