Baidu выкатила мощную новинку в компьютерном зрении - PaddleOCR-VL-1.5 🔥
Это уже не просто OCR, а полноценная VLM (Vision-Language Model) для работы с документами.
Что тут крутого:
✨ Всего 0.9B параметров - лёгкая модель, не монстр на сотни миллиардов
✨ Apache 2.0 - можно спокойно использовать в проде и коммерции
✨ 94.5% на OmniDocBench v1.5 - очень сильный результат по пониманию документов
✨ Мультиязычный OCR - уверенно читает редкие символы и даже древние тексты
Фактически это шаг к системам, которые не просто распознают текст, а понимают структуру сложных документов - таблицы, формы, исторические материалы, нестандартные шрифты.
Отличный кандидат для:
- интеллектуального парсинга документов
- оцифровки архивов
- финтеха, юр-доков, госбумаг
- AI-пайплайнов поверх сканов и PDF
Open-source экосистема вокруг VLM для документов сейчас очень быстро разгоняется 🚀
huggingface.co/PaddlePaddle/PaddleOCR-VL-1.5
Post #3195
3.79K

- 🔥 13
- ❤ 4