GitHub только что выкатил настоящий подарок для всех, кто делает multilingual AI и code models!
Опубликован GitHub Multilingual Repositories Dataset — метаданные по более чем 40 миллионам публичных репозиториев (80+ млн строк классификаций). Для каждого репо есть язык README, самого комментируемого issue и PR (первые 150 символов + confidence от нескольких классификаторов).
Португальский лидирует в README (3+ млн репо), корейский — в issues. Всё под CC0-1.0 (можно использовать свободно, без attribution).
Это не просто «ещё один датасет».
Это реальный инструмент, чтобы:
лучше понимать, как разработчики общаются на разных языках
строить evaluation sets для AI coding tools
закрывать пробелы в multilingual поддержке.
Раньше такие данные были закрытыми или грязными. Теперь — чистые, структурированные и бесплатные.
Подробнее на официальном GitHub Blog
Репозиторий с данными: github.com/github/multilingual-repositories
#GitHub #AI #LLM #MultilingualAI #OpenData #DeveloperTools
Post #527
87

- ❤ 19
- 🔥 11
- 🆒 6
- 👨💻 2
- 🙏 1