سلام دوستان عزیز 👋
ما در پروژه Bina OCR در حال جمعآوری یک دیتاست بزرگ و متنوع برای آموزش و فاینتیون مدل OCR فارسی (تشخیص هوشمند متن) هستیم. هرچه داده بیشتر و واقعیتر داشته باشیم، مدل دقیقتر و کاربردیتر خواهد شد!
اگر دادههای زیر را دارید، خیلی ممنون میشیم کمک کنید:
۱. دادههای دستخط (Handwritten):
• جزوهها، یادداشتها و نامههای دستنویس
• فرمهای پرشده (اداری، بانکی، پزشکی، ثبتنام و ...)
• متن روی کاغذ، تخته، یا عکس گوشی
هرچی از دست خط خودتون باشه به نفعتونه چون این مدل دستخط شمارو بهتر تشخیص خواهد داد :))
→ ارسال به تاپیک: Data: Handwritten
۲. دادههای تایپشده / چاپی (Typed/Printed):
• اسناد رسمی، قراردادها، فاکتورها، قبوض
• صفحات کتاب، مجله، روزنامه
• گزارشها، نامههای رسمی، اسکرینشات اپ و وب
→ ارسال به تاپیک: Data: Typed
نکته مهم: حتی چند عکس هم خیلی ارزشمند است! عکسهای با کیفیت مختلف (تاریک، روشن، زاویهدار، نویزدار) عالی هستند چون مدل باید در دنیای واقعی کار کند.
برنامهنویسها و متخصصان: برای مشارکت فنی (دیتاست، مدل، کد) به گروه اصلی بپیوندید:
👉 https://telegram.me/bina_ocr
ممنون از لطف و مشارکت ارزشمند شما 🙏
این پروژه کاملاً متنباز است و مدل نهایی روی Hugging Face منتشر خواهد شد.
Post #407
4.56K
- 👍 9
- 🔥 3
- ❤ 2