Проект GREgORI и Calfa, единственная известная мне компания, которая оказывает услуги по автоматической транскрипции текстов на редких языках, опубликовали корпус объемом почти 6 млн слов на древнегреческом языке, созданный на основе Patrologia Graeca.
Туда вошли тома PG, которых не хватало в Thesaurus Linguae Graecae — прежде всего позднеантичные и византийские тексты.
CER, по их словам, достигает 1%. Данные доступны в нескольких форматах, в том числе с лемматизацией и POS-разметкой. Корпус можно использовать для полнотекстового поиска, анализа текстов и как silver data для обучения LLM.
GitHub проекта
Статья "The Patrologia Graeca Corpus: OCR, Annotation, and Open Release of Noisy Nineteenth-Century Polytonic Greek Editions"
Post #943
498