Продолжаю свои папирологические приключения. Мы с Аленой и группой более 40+ волонтеров сделали за 2.5 месяца (это очень быстро. Кто-то мог бы успешно пару миллионов в грантах распилить на такое за пару лет) первый на свете неплохой OCR для древнегреческих папирусов. И презентовали его на паре эвентов в Вене.
Это — первый кусочек гораздо бОльшего проекта по редиджитализации различных папирологических тулов под одним зонтиком: PapyBench. Например, скоро будет MCP для поиска по опубликованным папирусам.
Сервис для OCR называется Anagnostes: так в Греции называли рабов, которые читали вслух. По ссылке можно почитать побольше и прогнать до 5 папирусов бесплатно для ознакомления, но пожалуйста не надо (ну только если вам прям очень хочется): это стоит личных кровных посленалоговых денег. За пару недель, им попользовались примерно все нужные люди, создали больше 100 аккаунтов и проанализировали больше 200 папирусов. Чтобы похвастаться, там и Оксфорд, и Кембридж и Беркли и кого там только нет.
Может возникнуть резонный вопрос: а зачем вообще это все? Ответ достаточно очевиден:
1) Это нишево
2) Это весело
3) Помимоо свитков Геркуланума, в папирологической области (оказалось) еще поле непаханое того, что можно сделать.
Например, по свету разбросаны примерно еще 1.5 миллиона папирусов, доживших до нас. А сейчас опубликовано/прочитано вообще скажем около 70-80к. Если дать эту задачу всем папирологам на свете, то на расшифровку этого миллиона нужно порядка 2000 лет. А интересно там что-то точно есть, но сейчас это иголка в стоге сена и так просто это не найти. Вот поэтому эта история и происходит. Ведь так приятно найти какое-нибудь письмо брата брату, в котором он просит прислать себе маленькую овцу. Или как учитель жалуется, что ему дают изъеденное долгоносиками зерно.
Поэтому впереди еще много чего интересного, даже статью засабмитили в какой-то журнал (скоро покажу).Удивительно конечно, как простое перемножение матриц может стать enabler'ом какого-то такого хобби-ресеча.
Post #2248
509

- 🔥 24
- ❤ 4
- 💘 3