Где VLM не читали старых газет: разбираем PereStruct, открытый датасет и модульный парсер
Откройте скан советской газеты. Глаз сам находит крупный заголовок, ведёт к продолжению в соседней колонке, отличает подпись под фотографией от основного текста. Для алгоритма перед ним выцветшая страница с десятками тесно расположенных прямоугольников, нестандартными шрифтами и неоднозначным порядком чтения.
Казалось бы, тут и пригодится большая мультимодальная модель, которой можно отдать картинку страницы и сразу получить готовый текст. Один запрос вместо детектора, распознавания и сборщика структуры. На деле такая модель дописывает несуществующий текст, зацикливает фразы и склеивает соседние статьи в одну.
Авторы PereStruct пошли другим путём и собрали пайплайн из отдельных узких компонентов, каждый со своей проверяемой задачей.
Post #69456
16.8K

- 🔥 20
- ❤ 6
- 🤝 4
- 🙏 3
- 🤡 3
- 💯 3
- 🤔 2
- 😢 2
- 🥰 1
- 😁 1
- 💩 1