На днях набрела на датасет Latin-PD (Public Domain), который позиционируется как крупнейший открытый сборник латинских текстов.
Заявлено 16,5 млрд слов из 160 тысяч латинских книг, изданных до 1884 года. Все можно свободно использовать для обучения нейросетей и любых других целей без ограничений. Проект реализован при поддержке французского правительства и еще каких-то организаций.
Выглядит волнующе. Поэтому я полдня разбиралась с тем, как это все прочесть, либо скачав паркеты на свою машину, либо отправляя запросы через duckDB. В первом случае при чтении базы через arrow просто вылетала сессия на этапе вытаскивания текста (при этом каталог нормально видно), второе решение сработало, но выборочно.
В итоге всех этих мучений добыла-таки один текстик, внутри буквально абракадабра, не имеющая отношения к латыни (точная реплика того, что хранится в ocr на архив.орге - пример на фото). Дальше решила не мучиться.
В связи с чем хочу поздравить правительство Франции с выгодной инвестицией. Ну и я тоже молодец, полдня на симулякр потратила.
#bad_data
Post #832
728

- 😁 13
- ❤ 10
- 🔥 2
- 😢 2