دیتاست عظیم متنبهتصویر
یه انتشار جالب از یک دیتاست متنبهتصویر خیلی بزرگ و اپنسورس جدید به اسم دیتاست MONET. واقعاً دیدن چنین چیزی خیلی ارزشمنده، چون تولید تصویر فقط به دادههای باکیفیت وابسته نیست، بلکه به منابع مهم دیگهای مثل بنچمارکها هم نیاز داره؛ چیزهایی که میتونن به تیمها کمک کنن خیلی سریعتر تو این حوزه پیشرفت کنن. هرچی فرایند گردآوری داده بهتر، فیلترها دقیقتر، کپشنها باکیفیتتر و اطلاعات منبع شفافتر باشه، واقعاً میتونه تفاوت بزرگی ایجاد کنه.
این دیتاست شامل ۱۰۴.۹ میلیون جفت تصویر–متن پالایششده هست که از بین حدود ۲.۹ میلیارد جفت خام استخراج شده. توی این فرایند هم کلی کار انجام شده: فیلترهای ایمنی، فیلتر دامنهای، حذف تکراریهای دقیق و نزدیک به هم، بازنویسی کپشنها با کمک چند مدل چندوجهی (multi-VLM)، تولید embeddingها، حاشیهنویسی اشیاء و چهرهها، هشگذاری، امتیازدهی NSFW و واترمارک، و حتی latentهای از پیش کدگذاریشدهی SANA-VAE برای اینکه آموزش مدلهای diffusion در فضای latent سریعتر انجام بشه.
لینک دیتاست
https://huggingface.co/datasets/jasperai/monet
@DevTwitter | <Reza Jafari/>
Post #12193
7.22K

- ❤ 17
- 🔥 6