TGViewer
ilovedocs | AI ilovedocs | AI @docsllm_channel · 4.6K subscribers
Post #240 2.33K
Распознавание текста

В судебной работе постоянно приходится работать с материалами дела. А их исходник после ознакомления в суде иногда оставляет желать лучшего.

Мы уже говорили о том, что для нормальной работы с документами нейросети нужен подходящий формат файлов. Если у вас есть только фото, тут два пути:

(1) Загрузить фото сразу в нейросеть и попросить ее проанализировать документ.

Тогда нейросеть использует свой встроенный OCR-модуль (инструмент для извлечения текста с фото). Качество последующей работы будет зависеть от того, насколько хорошо нейросеть распознала текст.

(2) Сначала отдельно распознать текст, а уже потом загрузить в нейросеть документ с распознанным содержанием.

Этот вариант позволяет не тратить токены дорогой нейросети, а сначала прогнать фото через более слабую модель или отдельный OCR-инструмент. Тут есть разные рабочие варианты.

@borouhin протестировал несколько инструментов на образцово-показательном фрагменте из материалов дела: плохое качество, курсив, выделение жирным, сложный юридический текст.

• Классика FineReader 15

Текст распался, появились странные символы, обрывки слов и фразы, которые сложно использовать без серьезной ручной правки. Ушла эпоха.

• Claude (Opus 4.6)

Он тоже оказался хуже: выдал грамматически корректный, но бессвязный текст. И на токенах тут можно разориться.

• GLM-OCR

Специализированная модель для распознавания документов. Справилась заметно лучше, но результат все равно получился с ошибками: «апелляционной инструкции», «суд первой инструкции», «общеразрядским основаниям».

Есть мнения, что она плохо работает с кириллицей.

Можно использовать через внешний сервис (т.е. на чужом сервере) или развернуть локально, т.е. на своем компьютере / сервере*.

• DeepSeek-OCR-2

На этом же фрагменте дал почти идеальный результат. Больше подходит для развертывания локально.

*Возможность развернуть распознавание локально лучше отвечает требованиям конфиденциальности и адвокатской тайны, потому что материалы не уходят на чужой сервер.

_________________________________

Сообщество юристов, которые покоряют нейросети
Канал | Курс
  • ❤ 13
  • 👍 11
  • 🔥 7
More from @docsllm_channel
  1. Sep 18, 2026Post #306
  2. Sep 17, 2026Нейросеть у себя на компьютере: зачем и как? Локальная LLM — это модель, которая работает…
  3. Sep 16, 2026Как юристу использовать ИИ-агентов в своих задачах В этот четверг, 17 сентября в 11:00 по…
  4. Sep 14, 2026Мониторинг судебной практики: как такое сделать? Опять нашли золото в нашем чате. На этот…
  5. Sep 12, 2026Работа с агентами: внедрение Раньше все обсуждали, как написать хороший промпт. Сейчас в н…
  6. Sep 9, 2026Транскрибируем аудио в домашних условиях В нашей работе аудио копятся довольно легко: суде…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →