TGViewer
RAntiquity RAntiquity @rantiquity · 1.27K subscribers
Post #832 728
На днях набрела на датасет Latin-PD (Public Domain), который позиционируется как крупнейший открытый сборник латинских текстов.

Заявлено 16,5 млрд слов из 160 тысяч латинских книг, изданных до 1884 года. Все можно свободно использовать для обучения нейросетей и любых других целей без ограничений. Проект реализован при поддержке французского правительства и еще каких-то организаций.

Выглядит волнующе. Поэтому я полдня разбиралась с тем, как это все прочесть, либо скачав паркеты на свою машину, либо отправляя запросы через duckDB. В первом случае при чтении базы через arrow просто вылетала сессия на этапе вытаскивания текста (при этом каталог нормально видно), второе решение сработало, но выборочно.

В итоге всех этих мучений добыла-таки один текстик, внутри буквально абракадабра, не имеющая отношения к латыни (точная реплика того, что хранится в ocr на архив.орге - пример на фото). Дальше решила не мучиться.

В связи с чем хочу поздравить правительство Франции с выгодной инвестицией. Ну и я тоже молодец, полдня на симулякр потратила.

#bad_data
  • 😁 13
  • ❤ 10
  • 🔥 2
  • 😢 2
More from @rantiquity
  1. Sep 17, 2026🌋 Vesuvius Challenge: как машинное обучение сделало возможным чтение обугленных свитков �…
  2. Sep 12, 2026Post #949
  3. Sep 8, 20261. Приготовилась, жду, когда кто-нибудь скажет, что правильный ответ: не использовать. 2.…
  4. Sep 8, 2026Как филологу-классику использовать нейросети? Канал @antibarbari совместно с @rantiquity с…
  5. Sep 5, 2026Дорогие друзья! Мы запустили Анагноста - с помощью ИИ он может делать транскрипцию греческ…
  6. Aug 31, 2026еще у меня сегодня две новости из мира айти. 1) статистика телеграма нарисовала мне котика…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →