📊😎💡Выпущены два самых огромных открытых датасета для распознавания текста
Наборы данных содержат миллионы реальных документов, изображений и текстов для задач распознавания текста, анализа и разбора документов
VQA - датасет, который используется для разработки и оценки моделей машинного обучения, способных отвечать на вопросы, связанные с изображениями. В датасете каждому изображению приписаны вопросы, а также правильные ответы на эти вопросы. Этот датасет дополнен аннотациями из проекта idl_data Бриттена. Дополненный датасет можно загрузить с помощью Python-скрипта:
from datasets import load_dataset
dataset = load_dataset("pixparse/idl-wds")
PDFA - это набор документов, отфильтрованный из корпуса SafeDocs, он же CC-MAIN-2021-31-PDF-UNTRUNCATED. Этот корпус предназнается для всестороннего анализа pdf-документов. Дополненный датасет можно загрузить с помощью Python-скрипта:
from datasets import load_dataset
dataset = load_dataset("pixparse/pdfa-eng-wds")
Post #546
741