🚀 Baidu представила самую эффективную мультимодальную модель в мире
Она называется PaddleOCR-VL - монстр с 0,9 млрд параметров, который превосходит GPT-4o, Gemini 2.5 и все существующие Doc-AI-модели.
Модель понимает 109 языков, распознаёт текст, таблицы, формулы и графики, при этом работает *быстрее систем, которые в 10 раз больше по размеру.*
Секрет успеха:
- 🧠 Динамический визуальный энкодер в стиле NaViT
- 💬 Языковая модель ERNIE-4.5-0.3B
- 🧾 Интеллектуальная система разметки PP-DocLayoutV2, устраняющая галлюцинации
Всё с открытым исходным кодом и менее 1 млрд параметров.
Это не просто эффективная модель — это новый эталон мультимодального ИИ.
🔗 https://huggingface.co/PaddlePaddle
Post #1577
2.23K

- ❤ 12
- 🤓 2