Bina OCR رو کلاً یک هفتهست که استارت زدیم و امروز اولین بنچمارک واقعی رو ازش گرفتیم... نتیجه حتی برای خودمون هم غیرمنتظره بود. مدل Bina 0.1 توی تستهای OCR فارسی جلوتر از مدلهای بزرگی مثل Gemini 3.5 Flash قرار گرفت. البته این تازه اول مسیره و هنوز کلی باگ و کار زمینمونده داریم.یکی از چالشهای اصلی توی این حوزه، خوندن دستخطهای واقعی فارسی بود. همون نوشتههای کثیف، جزوهها، سندهای قدیمی و فرمهای اداری که معمولاً سیستمهای OCR تجاری و بزرگ هم جلوشون زانو میزنن. تستهای اولیهای که روی متنهای دستنویس قدیمی گرفتیم نشون میده مسیر رو درست رفتیم، ولی کار هنوز خیلی زیاده...
این پروژه با همکاری رضا سیار جلو رفته که قبلاً هم سیستم شنوا (ASR فارسی) رو توسعه داده بود. از اون دست به کیبوردهایی که کمتر حرف میزنن و بیشتر کد میزنن. (اسپویلر: پروژه بعدی هم قراره tts فارسی باشه)
واقعیت فنی اینه که ساختن یه مدل خوب، بیشتر از اینکه درگیر بازی با معماری و مدلهای عجیبوغریب باشه، لنگِ دادهست. برای اینکه نسخههای بعدی
Bina OCR بتونن کارهای سختتر رو انجام بدن به چندتا چیز نیاز مبرم داریم: دادههای متنوعتر، اسناد واقعیتر، دستخطهای نامرتب و البته قدرت پردازش (compute) برای آموزش و تست.اگر حوزه اپنسورس و ابزارهای پایه برای فارسی براتون دغدغهست، میتونید توی توسعه این زیرساخت کمک کنید. فرقی نداره با به اشتراک گذاشتن دادههای متنی و تصویری، کمک فنی به توسعه، معرفی پروژه یا حتی حمایت مالی برای هزینههای سنگین
labeling و اجاره GPU. هدف اینه که کامیونیتی اوپن سورس فارسی پیشرفت کنه نسخه اولیه مدل :
https://huggingface.co/Reza2kn/Bina-0.1
کامیونیتی تلگرام پروژه :
https://t.me/bina_ocr
🛠 Join @LLMEngineers Community