TGViewer
Приближаем сингулярность Приближаем сингулярность @building_singularity · 887 subscribers
Post #55 695
Какой размер датасета 📚 нужен для дообучения❓

Точного ответа конечно нет, но есть статьи где показали
- профит с гигантским датасетом: Orca на 5М инструкций и ответов, полученных от GPT-4
- профит с небольшими, но очень качественными датасетами

Например в статье Less is More for Alignment (LIMA) чуваки из Meta вручную собрали датасет из 1000 примеров. Дообучение на нем дает результаты лучше, чем на 52к примеров из Alpaca датасета.

Но вручную собирать дорого и долго, и в статье AlpaGasus предложили автоматизировать это (рис. 1)

Ученые придумали промпт 🧠

Причем они даже не пробовали разные, просто сказали что воспользовались этим (рис. 2) и всё 👍

Использовали GPT-4 с этим промптом, чтобы для пар (инструкция, ответ) получить оценку от 0 до 5 - насколько они подходят друг другу. Проскорили все пары в Alpaca и выбрали 9k примеров с оценкой больше 4.5. Дообучили модель на этих 9к и сравнились с обучением на 52к аж на 4 тест сетах:

- WizardLM 250к сложных примеров evol-instruct методом
- Vicuna 70к диалогов с ChatGPT
- Koala 260к разных датасетов (QA, диалоги с LLM, ...)
- Self-Instruct 82к инструкций и ответов, сгенерированных GPT-3

Выглядит как хороший замер, да вот только примеров в тест сетах было 180, 80, 218 и 252 соотвественно 😵

Замеряли качество используя GPT-4, так что я вообще не понял, почему так мало. Тем не менее, по всем тест сетам стало лучше (рис. 3)

На других обучающих данных свой подход автоматической фильтрации они не пробовали. Возможно, потому что на GPT-4-distilled датасетах (типа vicuna) это и работать не будет. Статья в общем то не очень (на мой взгляд; плюс это препринт), но есть пара вещей, которые мне кажутся действительно полезными и применимыми на практике:

1️⃣ Маленький и качественный дотасет как отличная начальная точка; больше данных не всегда лучше
2️⃣ Фильтровать ответы моделей (не ChatGPT/GPT-4) по небинарным скорам от GPT-4 (хотя в первую очередь имеет смысл просто сгенерировать ответов от GPT-4 на своем домене)

subscribe
like, share, repost :D
  • 👍 12
  • 🔥 3
  • ❤ 1
  • 😁 1
More from @building_singularity
  1. Aug 8, 2025И забавно, и грустно…
  2. Jul 22, 2025Последние 5 месяцев работаю в стартапе Slingshot AI. И сегодня мы публично анонсируем наш…
  3. Nov 29, 2024H100 девешле A100 Я уже писал про тренд на уменьшение цены инференса LLM. Недавно на работ…
  4. Nov 24, 2024Big life update 🚀 Были довольно напряжные и загруженные несколько месяцев, но всё это ока…
  5. Sep 3, 2024Andrew Ng про цену LLM инференса За последний год цена на лучшую модель OpenAI уменьшилась…
  6. Jul 31, 2024У нас тут в Ex-Human появилась классная вакансия на Senior NLP инженера ⚡ https://botifyai…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →