Данных мало не бывает. Но хороших и как-то оценённых особенно.
Именно поэтому я решил скомбинировать все плюс-минус полезные conversational/instruct датасеты с русским языком в один.
Сначала я начал с 30+ датасетов, но некоторые из них пришлось отбросить полностью по причине очевидного низкого качества.
К сожалению, часть источников - это автоматические переводы или вообще имеют сомнительное происхождение и качество.
Это было заметно как во время файнтюнинга различных моделей по этим данным, так и даже во время простого беглого осмотра глазами.
Размечать 2+ млн. примеров руками конечно же не хотелось. Поэтому был написан хитрый промт для GPT-4.1 и данная задача была доверена ему.
В результате осталось 1.7 млн примеров, которые можно использовать. А если отфильтровать по engagement >= 5, то останется около 1.47 млн. примеров.
Да, это много токенов, но это честная работа.
Dataset size
Train: 1 710 601 samples (filtered from 2_149_360)
Test: 18 520 samples (not filtered)
🤗 Big Russian Dataset уже доступен на HuggingFace: https://huggingface.co/datasets/ZeroAgency/ru-big-russian-dataset
