Решила открыть тег #bad_data для отзывов на разные чудные датасеты. Сегодня, например, такой: https://www.kaggle.com/datasets/navjotkaushal/human-vs-ai-generated-essays
Что-то заподозрила, когда простое дерево решений, безо всякого бэггинга и бустинга, сразу дало точность 98%. Ну и ну, думаю! Это я такой хороший препроцессор написала?
Смотрю структуру дерева: оно сильно "подрезано", буквально одна фича решает. Ах, вот оно что: большая часть текстов, сгенерированных людьми, в этом датасете отличается от AI-generated ДЛИНОЙ. Занавес.
Post #841
956
RAntiquity На днях набрела на датасет Latin-PD (Public Domain), который позиционируется как крупнейший открытый сборник латинских текстов. Заявлено 16,5 млрд слов из 160 тысяч латинских книг, изданных до 1884 года. Все можно свободно использовать для обучения нейросетей…Kaggle Human vs AI Generated Essays
- 😁 20
- 😭 6
- 🔥 3
- 👾 1