TGViewer
Data Science Links Data Science Links @datasciencelinks · 559 subscribers
Post #119 388
Фильтруй базар! Как мы параллельный русско-башкирский корпус чистили
Чтобы обучать нейросети понимать и генерировать человеческие языки, нужно много качественных текстов на нужных языках. «Много» – не проблема в эпоху интернета, но с качеством бывают сложности. В этом посте я предлагаю использовать BERT-подобные модели для двух задач улучшения качества обучающих текстов: исправление ошибок распознавания текста из сканов и фильтрация параллельного корпуса предложений. Я испробовал их на башкирском, но и для других языков эти рецепты могут оказаться полезны.
https://habr.com/ru/articles/744972/
Хабр Фильтруй базар! Как мы параллельный русско-башкирский корпус чистили Чтобы обучать нейросети понимать и генерировать человеческие языки, нужно много качественных текстов на нужных языках. «Много» – не проблема в эпоху интернета, но с качеством бывают сложности. В этом...
More from @datasciencelinks
  1. Dec 8, 2023Apple выпустила новый ML фреймворк для чипов Apple Silicon https://github.com/ml-explore/m…
  2. Nov 17, 2023Бесплатный список эффективных запросов к ChatGPT https://github.com/f/awesome-chatgpt-prom…
  3. Nov 16, 2023Детальное сравнение больших языковых моделей. За последние несколько месяцев такие техноло…
  4. Sep 23, 2023https://habr.com/ru/articles/755770/
  5. Sep 19, 2023https://habr.com/ru/articles/754594/
  6. Sep 18, 2023https://habr.com/ru/articles/754742/
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →