💡 SmolTalk: синтетический англоязычный датасет для обучения LLM
SmolTalk — это синтетический датасет от HuggingFace, созданный для обучения LLM с учителем. Состоит из 2 млн строк и использовался для разработки моделей SmolLM2-Instruct.
🔥Датасет включает как новые, так и существующие наборы данных
😎Новые наборы данных:
✅Smol-Magpie-Ultra (400 тыс. строк)
✅Smol-constraints (36 тыс. строк)
✅Smol-rewrite (50 тыс. строк)
✅Smol-summarize (101 тыс. строк)
⚡️Существующие наборы:
✅OpenHermes2.5 (100 тыс. строк)
✅MetaMathQA (50 тыс. строк)
✅NuminaMath-CoT (1120 тыс. строк)
✅Self-Oss-Starcoder2-Instruct (1120 тыс. строк)
✅SystemChats2.0 (30 тыс. строк)
✅LongAlign (менее 16 тыс. токенов)
✅Everyday-conversations (50 тыс. строк)
✅APIGen-Function-Calling (80 тыс. строк)
✅Explore-Instruct-Rewriting (30 тыс. строк)
📚Результаты обучения:
SmolTalk показал значительные улучшения в производительности модели, особенно в задачах математики, программирования и следования системным промптам. Обучение на SmolTalk дало лучшие результаты по меткам IFEval, BBH, GS8Mk и MATH, в том числе при обучении Mistral-7B.
Post #650
560
- 👍 1