TGViewer
̶с̶а̶м̶̶о̶изолента мёбиуса ̶с̶а̶м̶̶о̶изолента мёбиуса @izolenta_mebiusa · 2.77K subscribers
Post #340 2.03K
(2/2, начало)

Одна из причин, почему мы стали делать перевод на базе LLM — чтобы можно было использовать few-shot примеры для тех языков, которые модель выучила не очень хорошо, или для каких-то сложных предметных областей. Поиск примеров в параллельном корпусе сделали частично по всеязычным эмбеддингам OmniSONAR (про них в следующем посте), частично по словам (ибо для многих языков эмбеддинги не идеальны). Для поиска по словам пришлось «переизбрести» ранжирование TF-IDF, добавив в него попытку сделать так, чтобы найденные тексты в совокупности покрывали все слова текста-запроса. Плюс для переранжирования примеров использовали смесь разных сигналов качества (ибо хорошие примеры лучше плохих, но плохие лучше, чем никакие). Выяснилось, что добытые подобным образом примеры дают большой буст к качеству перевода с трудного языка на легкий, и умеренный – с лёгкого на трудный. Но всё сильно зависит от того, сколько примеров в базе для поиска, насколько они релевантны тестовому датасету, и насколько пересекаются с тем, что модель уже видела в ходе обучения.

В целом, рискну заявить, что в первом приближении задачу «машинного перевода для всех языков» модели OMT-LLaMA решили: они худо-бедно могут понимать и генерировать больше тыщи языков (согласно вышеупомянутому библейскому бенчмарку), а для плохо подержанных языков всегда можно нарастить качество с помощью RAG, небольшого дообучения на специализированном датасете, или их комбинации (она обычно работают лучше, чем что-то одно), если для них появились данные. Если бы нам дали заопенсорсить OMT-LLaMA, то я бы их сейчас абсолютно всем рекомендовал в качестве базовой модели для машинного перевода. Но увы, на данный момент это не очень светит. Хорошая новость, впрочем, что при наличии вычислительных ресурсов воспроизвести их будет не очень сложно.

В следующих постах расскажу про OmniSONAR, OMT-NLLB, и как мы всё это оценивали.
  • 🔥 32
  • ❤ 9
  • 👏 3
More from @izolenta_mebiusa
  1. Aug 24, 2026Мои знакомые сейчас собирают "Last Translation Benchmark" — заведомо сложный бенчмарк зада…
  2. Jul 28, 2026У меня наконец-то дошли руки научиться, как обновлять веб-приложение https://bouquet.metad…
  3. Jul 26, 2026С тех пор, как я ещё в 2023 выкладывал тьюториал по дообучению моделей NLLB, я был уверен,…
  4. Jul 4, 2026Очень лениво заниматься абсолютно всем. То ли я выгорел, то ли вконец офранцузился, то ли…
  5. Jun 14, 2026Пост про путешествия, а не про NLP: моя супруга Дарина (inst @cloudberrin) в этом году сно…
  6. May 28, 2026Три маленьких апдейта по датасету BOUQuET (напомню, что это наш бенчмарк для мультиязычног…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →