На форуме Digital Almaty премьер-министр России Михаил Мишустин поднял тему невозможности создания нейтральных языковых моделей, так как они всё равно будут отражать взгляды своих разработчиков.
Я бы развил эту тему и сказал, что это очередной пример значения bias (предвзятости) в выборке данных, на которых обучается модель. Но тут есть большая сложность: обучение модели с нуля требует огромных ресурсов.
К примеру, большая языковая модель GPT3 на момент релиза в 2020 году имела 175 млрд параметров. Обучение модели происходило на суперкомпьютере Microsoft Azure AI, который был построен специально для этих задач. Компания Lambda Labs подсчитала, что на такое обучение могло уйти от 4,6 млн долларов. Для обучения алгоритма исследователи собрали набор данных из более 570 ГБ текстов, английскую Википедию, два датасета с книгами и датасет WebText2 с текстами веб-страниц.
Учитывая стоимость, а также требования к объему данных для начальной разработки модели, разработчики вынуждены брать чужие модели и датасеты из свободного доступа, а уже потом дообучать на своих данных.
В случае с русским языком стоит учитывать, что многие общедоступные датасеты изначально мало внимания уделяли русскоязычным текстам. К примеру, лишь 0,11 % документов, входящих в датасет обучения GPT3, были на русском языке. Что заметно в работе с ChatGPT, который часто отвечает некорректно, если ответ требует понимания культурного контекста.
Учитывая такие вводные, построение собственных моделей и датасетов выглядит актуальной задачей для любого государства, нацеленного на эффективное внедрение ИИ.
Post #122
233