Когда копирайтер прогоняет свой текст через DeepL или Google Translate, грамматика на выходе обычно чистая, но синтаксические привычки родного языка остаются. Я решил проверить, насколько легко это ловится, и натренировал простую модель с помощью Claude. Она угадывает исходный язык (русский, немецкий, итальянский и ещё 6) с точностью 72%. При этом Native English определяется почти идеально - 96%.
Никакого BERT, GPT и LLM. Просто TF-IDF + линейный SVM (вектора). Эта архитектура выиграла соревнование PAN-2017 по определению родного языка автора по его английскому тексту (ссылка на ресерч). Вся эта движуха называется Native Language Identification (NLI).
Мой обучающий корпус состоял всего из 600 пар по каждому языку "оригинал - английский перевод". И этого хватило!
Hi! Today I want to show you that it's actually quite easy to determine the original translation language. For example, if you wrote a text in...
Модель угадала, что это перевод с русского.
