Post #100
313
CCMatrix - самый большой на сегодня датасет для машинного перевода, в 50 раз больше WikiMatrix: около 4,5 миллиардов параллельных предложений в 576 языковых парах. При создании использовались методы массивно-параллельной обработки информации и библиотека FAISS для быстрого поиска по сходству. Автоматизированный и распараллеленный процесс интеллектуального анализа битов обрабатывал сразу несколько пакетов с данными по 50 миллионов примеров одновременно на сервере с 8 графическими процессорами. Благодаря этому удалось быстро извлекать предложения на разных языках из множества общедоступных текстов. Ожидается, что CCMatrix улучшит системы машинного перевода и поможет разработать новые способы создания крупномасштабных мультиязыковых датасетов. Подробную статью на английском читайте здесь: https://ai.facebook.com/blog/ccmatrix-a-billion-scale-bitext-data-set-for-training-translation-models/
Meta CCMatrix: A billion-scale bitext dataset for training translation models With 4.5B parallel sentences in 576 language pairs, CCMatrix is the largest dataset of high-quality, web-based bitexts for training translation models. Now Facebook AI is sharing tools for other researchers to use this corpus for their work.