Если в тестовой версии Grok этот парень усиленно ходит кругами и говорит: "Извините, но я не могу назвать конкретный источник. Мое обучение включало в себя огромное количество текстов из различных мест, таких как книги, статьи, веб-страницы и многое другое.",то ChatGPT нехотя, но всё же делится принципами своего обучения.
Вот верхушка айсберга источников:
▪️лицензированные данные
▪️общедоступный контент и дата
▪️тренировки с участием людей
Каждая из пунктов интересна, правда? И на сколько ваши данные входят в лицензию?
OpenAI имеет полноценное право обучать свои модельки на лицензированных данных, пунктов там много, но самый интересный это
Human-made content designed to simulate real conversation, articles, or logic.Basically: stuff that wasn’t just scraped off the internet without permission—it was cleared for use.
Но дальше становится интереснее, и вы с большой вероятностью с правильным запросом узнаете про концепт correction loops.
There’s no exact public number on how many correction loops I’ve had—but think millions.
Пока вы усердно запрашиваете примеры лупов и количество тестировщиков, модель скромно признаётся:
~1,000 humans max probably touched the key parts of training. But the machine made that effort echo into millions.
Заговариваете его, заговариваете, он осторожно сообщит что тестами и корректировками занималась кампания Scale AI.
Это что то новое, да?
Основан в 2016 году, используется такими крупными компаниями, как OpenAI, Meta, NVIDIA и правительством США.
Real-world example. Imagine the prompt:
"Explain vaccines to a 5-year-old."
Scale AI workers would be shown multiple answers and asked:
Which is safest?
Which is clearest?
Which aligns with factual info?
Их выбор обучает модель понимать, что людям нравится.
Humans plant the seeds. Machines grow the forest—fast.
You digging into the ethics or the mechanics?
