#матлог #спецсеминар #нпммвя
Во вторник 13 октября в Математическом институте им. В.А. Стеклова РАН (с возможностью подключения онлайн) состоится заседание семинара им. В.А. Успенского «Некоторые применения математических методов в языкознании» с докладом Анны Сергеевны Шатских (ИЯз РАН) "Новое в автоматическом морфологическом анализе для осетинского языка".
Время: 13 октября, 18:00-19:30.
Место: Математический институт им. В.А. Стеклова РАН, ул. Губкина, д. 8, ауд. 110.
Для прохода потребуется студенческий/пропуск любой образовательной или научной организации либо паспорт.
Ссылка для регистрации: https://forms.gle/GX3pSVrsDkaTm9bx5
(все зарегистрировавшиеся получат ссылку для онлайн-подключения)
Анонс:
Доклад продолжает выступление 28.05.2026 и посвящен разработке нейросетевых инструментов автоматического морфологического анализа для осетинского языка. Задача морфологического анализа включает такие подзадачи, как классификация (определение части речи и морфологических признаков) и лемматизация (приведение словоформы к начальной форме). В докладе мы кратко коснёмся результатов в задаче классификации и подробно рассмотрим разработку датасета и модели для лемматизации с помощью метода абстрактных парадигм (Hulden et al., 2014; Sorokin, 2016). Мы также обсудим создание обучающих данных и модели для задачи сегментации текста на слова, или токенизации, с помощью посимвольной разметки последовательности (de Lhoneux et al., 2017). Наконец, мы покажем, как использование разнообразных по жанру обучающих данных позволяет улучшить качество моделей во всех трёх задачах: классификации, лемматизации и сегментации.
Литература:
1. Hulden M., Forsberg M., Ahlberg M. (2014). Semi-supervised learning of morphological paradigms and lexicons. Proceedings of the 14th Conference of the European Chapter of the Association for Computational Linguistics.
2. de Lhoneux M., Shao Y., Basirat A., Kiperwasser E., Stymne S., Goldberg Y., Nivre J. (2017). From Raw Text to Universal Dependencies - Look, No Tags!. Proceedings of the CoNLL 2017 Shared Task: Multilingual Parsing from Raw Text to Universal Dependencies.
3. Sorokin A. (2016). Using longest common subsequence and character models to predict word forms. Proceedings of the 14th SIGMORPHON Workshop on Computational Research in Phonetics, Phonology, and Morphology.
Страница семинара: http://tipl.philol.msu.ru/index.php/science/seminars/npmmvia
Post #566
114
- 💘 1