Как синтетические данные применяются для реальных задач? Так ли синтетика эффективна?
Продолжая тему синтетики и ее использования для задач, можем вспомнить кейс Microsoft Research, где они обучали модель Phi-1 и Phi-2 на текстах, сгенерированых Chat GPT 3.5.
Если у вас есть большая LLM и вы хотите сделать легкую под конкретный домен, то можно сгенерировать синтетические данные на большой и на них обучать более легкую LLM, и одна будет давать хорошее качество в узких доменных областях. Обычно компании тратят огромные средства, чтобы сделать разметку для LLM, а с помощью синтетики можно сделать разметку дешевле и быстрее.
Модерация
Тут может быть интересен подход Open AI. Они придумали, как обучать модель на синтетических данных, полученных с помощью LLM. Предположим, что у вас уже есть контрольная размеченная выборка, и есть инструкция для модераторов.
Тогда вы берете инструкцию, вставляете в промпт LLM модели и анализируете качество, которое получилось на контрольной выборке. Находите ошибки и редактируете инструкцию так, чтобы LLM работала лучше. Через 3-4 итерации вы получите промпт, который позволяет размечать ваши данные действительно качественно. Но проблема в том, что Chat GPT — довольно дорогая и медленная модель для продакшена на больших объемах. Open AI предлагает генерировать с помощью LLM синтетический датасет и обучать легковесную модель, которую вы будете использовать в задачах.
Интересно, что уже сейчас качество данных, выдаваемых LLM, колеблется между тем, что может выдать эксперт и обычный человек. А всего два года назад она вообще не могла соперничать с людьми.
Но есть проблема:
Синтетические данные часто отличаются от обычных данных, поэтому, когда мы обучаем алгоритм на синтетику, он переобучается на нее и показывает хороший результат только на синтетике, а на обычных данных работает нестабильно.
Однако мы видим и огромный прогресс: за последний год качество генерации синтетики стало на порядок выше. Когда качество генерации будет сопоставимо с качеством данных из реального мира, уже не будет возникать проблем с переобучением на синтетику, поэтому она станет более популярной.
И уже сейчас понятно, что в 2030 году больше половины данных для обучения будут сгенерированы, а настоящие данные будут отходить на второй план.
Post #99
1.73K
- 👍 7
- 🔥 3