Искусственный интеллект, нейросети, машинное обучение
Разместить рекламу: @tproger_sales_bot
Правила общения: https://tprg.ru/rules
Другие каналы: @tproger_channels
Сайт: https://tprg.ru/site
Зарегистрирован в РКН: https://tprg.ru/vcEg
Post #2907
737

Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок страницы в Markdown: текст, таблицы в HTML, формулы в LaTeX. Веса под Apache 2.0, в основе дообученные Qwen3-VL-Instruct.
Вместе с моделью команда опубликовала бенчмарк PureDocBench, где эталон берут прямо из исходного HTML/CSS страницы: при аудите OmniDocBench 1.5 авторы насчитали 2580 подтверждённых ошибок разметки на 21 353 проверенных блока. Одну и ту же страницу показывают в трёх видах с одинаковым правильным ответом: чистый рендер, десять сценариев цифровой порчи и четыре способа съёмки, вплоть до распечатки, снятой на телефон.
На чистом OmniDocBench первое место у PaddleOCR-VL 1.6 с 96,33 балла, а на порченых страницах у неё 66,98. У WeVisDoc-4B 95,38 и 75,54: в идеальных условиях уступает, в реальных выигрывает.
Русского в обучении нет, только китайский, английский и смешанные страницы. Я взял страницу из Википедии, добавил наклон, блик и шум под съёмку с рук и прогнал через модель: формулы вышли целыми, вплоть до erf и производящей функции моментов, в сплошном тексте местами опечатки вроде «с ником в центре» вместо «с пиком», а карточку со сводкой параметров модель отдала простым текстом вместо таблицы. Страница на RTX 3080 заняла две минуты, веса в bf16 занимают 9,4 ГБ видеопамяти.
@neuro_channel
Вместе с моделью команда опубликовала бенчмарк PureDocBench, где эталон берут прямо из исходного HTML/CSS страницы: при аудите OmniDocBench 1.5 авторы насчитали 2580 подтверждённых ошибок разметки на 21 353 проверенных блока. Одну и ту же страницу показывают в трёх видах с одинаковым правильным ответом: чистый рендер, десять сценариев цифровой порчи и четыре способа съёмки, вплоть до распечатки, снятой на телефон.
На чистом OmniDocBench первое место у PaddleOCR-VL 1.6 с 96,33 балла, а на порченых страницах у неё 66,98. У WeVisDoc-4B 95,38 и 75,54: в идеальных условиях уступает, в реальных выигрывает.
Русского в обучении нет, только китайский, английский и смешанные страницы. Я взял страницу из Википедии, добавил наклон, блик и шум под съёмку с рук и прогнал через модель: формулы вышли целыми, вплоть до erf и производящей функции моментов, в сплошном тексте местами опечатки вроде «с ником в центре» вместо «с пиком», а карточку со сводкой параметров модель отдала простым текстом вместо таблицы. Страница на RTX 3080 заняла две минуты, веса в bf16 занимают 9,4 ГБ видеопамяти.
@neuro_channel
- ❤ 3
- 👍 2
- 🔥 1








