За решение этой проблемы взялись участники студкемпа Яндекс Образования вместе с экспертами Центра технологий для общества Yandex Cloud. Работали над реальными задачами Библиотеки имени Н. А. Некрасова* и проекта «Электронекрасовка».
↪️ «Электронекрасовка» — это электронная библиотека и культурно-просветительское медиа, основу которого составляет системная оцифровка библиотечных фондов.
По мере роста цифровой коллекции появлялись сложные задачи. Например, как собрать разрозненные текстовые блоки на газетной полосе в цельные статьи.
Правила вёрстки отличались не только в разных изданиях, но даже на соседних страницах одной газеты. Заголовок мог растянуться на несколько колонок, а текст — обрываться и переноситься на другую часть полосы.
💿 Поэтому распознать только буквы было недостаточно. Нейросети необходимо понять семантику страниц и определить точный порядок чтения блоков, чтобы восстановить смысл публикации.
Так появился PereStruct — модульный пайплайн для восстановления логической структуры старинных газет.
🟣 PereStruct объединяет детектор вёрстки на базе YOLO, Yandex Vision OCR для распознавания текста, модели коррекции ошибок Yandex AI Studio и отдельную модель семантической сборки, которая «склеивает» фрагменты в единое целое.
Подробнее о том, как устроен пайплайн PereStruct и другие технические детали проекта, читайте в статье на Хабре.
Это не первое наше сотрудничество с Библиотекой им. Н. А. Некрасова. Ранее Центр технологий для общества Yandex Cloud помог автоматизировать базовую оцифровку: благодаря облачным сервисам обработка сканов сократилась с 11 минут до 25 секунд. Рассказывали об этом здесь.
*С 2024 года технологическим партнёром библиотеки является Центр технологий для общества Yandex Cloud. Мы предоставляем вычислительные ресурсы и помогаем перенести отдельные этапы обработки сканов в облако.
⚪️ Подписывайтесь: @ycsocialtech
