FineVision — огромный open-source датасет для обучения современных Vision-Language моделей!
В цифрах это выглядит так:
🖼 17.3M изображений
📦 24.3M сэмплов
💬 88.9M диалоговых шагов
🔡 9.5B токенов ответов
✨ Несколько интересных находок из датасета:
Разнообразие доменов: от повседневных фото до сложных технических изображений.
Многоступенчатые диалоги помогают моделям лучше понимать контекст.
Сильный фокус на качество аннотаций и баланс данных.
👉 FineVision открывает новые возможности для исследований и создания ещё более умных VLM-моделей
http://huggingface.co/spaces/HuggingFaceM4/FineVision
Post #1501
1.96K

- ❤ 4
- 👍 2
- 🔥 1