TGViewer
[PYTHON:TODAY] [PYTHON:TODAY] @python2day · 63.8K subscribers
Post #8007 11.3K
⚡️ HunyuanOCR — это не обычный OCR, который путает буквы и плачет от плохого качества.

Распознаёт текст на фото, сканах и даже кривых телефонных снимках с точностью, что ставит Google Vision в неловкое положение.

Что умеет:
📸 Считывает текст на любых изображениях — документы, фото, меню, вывески, рукописные заметки.
🧠 Мощная модель от Tencent — понимает структуру, расположение блоков, выделяет зоны текста.
🌚 Работает даже на плохих фото — шум, тени, наклон, бликующий экран — распознаёт всё.
😰 Есть Python-интерфейс — можно встроить в бота, сервис или свою автоматизацию.
🗂 Разбирает сложные макеты — таблицы, колонки, многостраничные файлы.
🆓 Полностью бесплатно и open-source.

▶️ Пример использования:
from vllm import LLM, SamplingParams
from PIL import Image
from transformers import AutoProcessor

def clean_repeated_substrings(text):
"""Clean repeated substrings in text"""
n = len(text)
if n<8000:
return text
for length in range(2, n // 10 + 1):
candidate = text[-length:]
count = 0
i = n - length

while i >= 0 and text[i:i + length] == candidate:
count += 1
i -= length

if count >= 10:
return text[:n - length * (count - 1)]

return text

model_path = "tencent/HunyuanOCR"
llm = LLM(model=model_path, trust_remote_code=True)
processor = AutoProcessor.from_pretrained(model_path)
sampling_params = SamplingParams(temperature=0, max_tokens=16384)

img_path = "/path/to/image.jpg"
img = Image.open(img_path)
messages = [
{"role": "system", "content": ""},
{"role": "user", "content": [
{"type": "image", "image": img_path},
{"type": "text", "text": "检测并识别图片中的文字,将文本坐标格式化输出。"}
]}
]
prompt = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = {"prompt": prompt, "multi_modal_data": {"image": [img]}}
output = llm.generate([inputs], sampling_params)[0]
print(clean_repeated_substrings(output.outputs[0].text))


♎️ GitHub/Инструкция

Где будет полезно:
🟢делай сервис распознавания чеков и документов;
🟢автоматизируй ввод данных для бизнеса;
🟢продавай обработку сканов на фрилансе;
🟢собирай «умного» Telegram-бота для OCR;
🟢создавай SaaS под маркетплейсы и бухгалтерию.

😳 Лайф | 📲 Зеркало Max

#python #soft #github
  • 🔥 34
  • 👍 14
  • ❤ 8
More from @python2day
  1. Sep 24, 2026😎 Когда узнал, что зарабатываешь больше айтишников
  2. Sep 23, 2026🎬 ИИ научили снимать рекламные ролики одной командой /brag — open-source инструмент, скил…
  3. Sep 23, 2026🚀 Новый релиз: Provision OCR 0.9.3 Большое обновление системы распознавания документов, к…
  4. Sep 23, 2026😯 Наступил звездный час для инфоцыган Чувак наглядно показал разницу нейросетей против ре…
  5. Sep 21, 2026🤖 Будущее наступило старик В Сан-Франциско стартап REK устроил первый публичный поединок…
  6. Sep 21, 2026⚡️ Linecast — настоящая погодная станция, карта мира и планетарий прямо в терминале. Open-…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →