TGViewer
Костальгин пишет … Костальгин пишет … @dk_pishet · 213 subscribers
Post #36 251
ИИ-агент «не шмог». Текущие пределы работы с документами

Протираем розовые очки и не боимся отстать от ИИ-хайпа

Вышел неплохой «рисеч» от ребят, которые специализируются на парсинге документов с помощью различных моделей: ParseBench. За супер подробностями можно обратиться уже к научной статье на arXiv.

Современные модели (VLM — Vision-Language Models) научились «видеть» документ и рассуждать об увиденном. Это важно, когда речь идет именно о сканированном документе, а не просто о текстовом слое, сохраненном в PDF.

Вердикт пока не очень позитивный, имхо. Хотя всё зависит, в буквальном смысле, от того, покупаете вы или продаете. Продавцов «ИИ-порошка» сейчас развелось достаточно.

Я же смотрю на это как потенциальный потребитель. И агрегированный лучший результат в 84% выглядит не сильно вдохновляющим (см. скриншот к посту).

В целом, на каждые 10 страниц ИИ-агент допустит существенное искажение: неправильно распознает, выдумает факт или пропустит важное. Удивительно, что у Anthropic их модель Haiku в некоторых критически важных для агентных сценариев задачах — например, извлечение данных из диаграмм — давала результаты в районе 5–8%. Это не „совокупная точность", а именно отдельная метрика, где ошибка означает, что агент не смог проверить источник цифры или правильно интерпретировать таблицу. Доверять такому агенту финансовые документы опасно. Это немножечко приподнимает розовые очки и снижает градус восторга, что нечто может прям всё и без ошибок.

В связи с этим у меня недавно случился занятный казус именно с моделями Anthropic. Попробовал для личной задачи проанализировать обычный текстовый PDF. Вместо 13 млн руб. модель увидела 15 млн руб. и далее делала глубоко идущие выводы на основе этой ошибки.

Хорошо, что заметил. О чем и посетовал в одном чатике технарю, который, по ощущениям, не сильно примыкал к ИИ-хайпу, хотя и активно продает курсы обучения. На что получил ответ в стиле: «Сам дурак — ты просто не умеешь готовить ИИ-агента».

Разумеется, как готовить — не было даже намёка. И это тоже показательно: у людей прямой конфликт интересов. Если будешь рассказывать про наличие ошибок такого уровня, то тяжело продавать «будущее» и стимулировать FOMO у аудитории. А уж навешать лапшу гуманитариям — отдельный вид спорта сейчас.

Поэтому никаких ИИ в продакшене ;)
#Технологии #ИИ
  • 🔥 7
  • 👍 4
  • ❤ 2
More from @dk_pishet
  1. Oct 1, 2026Краткое резюме в одной картинке на обширные поправки в Налоговый кодекс в рамках осеннего…
  2. Sep 10, 2026САППОРТ: «УВАЖАЕМЫЕ КОЛЛЕГИ, У ВАС СЛИШКОМ БОЛЬШОЙ…» Продолжим про цЫфровизацию. Появился…
  3. Sep 8, 2026БУМАГА — ЭТО НОВАЯ ЦИФРА! КАК ФНС ПРЕДЛОЖИЛА ПОДАВАТЬ ВОЗРАЖЕНИЯ Помните из телевизора «се…
  4. Sep 7, 2026Астрологи объявили цифровую неделю. Будем много говорить об этом, а может, даже спорить. —…
  5. Aug 21, 2026ЧТО СМОТРЕТЬ? Намедни вспомнился фильм «Граф Монте-Кристо» против налоговой 2024 года, на…
  6. Aug 19, 2026ТАКОЙ ФУТБОЛ НАМ НЕ НУЖЕН Недавно завершился чемпионат мира по футболу, многие пытались уг…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →