#матлог #спецсеминар #нпммвя
В четверг 28 мая в Институте языкознания РАН (с возможностью подключения онлайн) состоится состоится заседание семинара «Некоторые применения математических методов в языкознании» им. В.А. Успенского
с докладом Ани Шатских (МГУ) "Автоматическая морфологическая классификация для осетинского языка".
(перенос не состоявшегося ранее доклада)
Время: 28.05.2026, 18:00-19:30.
Место: Математический институт им. В.А. Стеклова РАН, ул. Губкина, д. 8, ауд. 104. Для прохода потребуется студенческий/пропуск любой образовательной или научной организации либо паспорт.
Ссылка для регистрации: https://forms.gle/JHdnkn9ApytBRV8ZA
(все зарегистрировавшиеся получат ссылку для онлайн-подключения; указавшие очное участие будут внесены в список на проход)
Анонс:
Доклад посвящён созданию датасета и нейросетевой модели для автоматической морфологической классификации в осетинском языке. Осетинский язык – иранский язык индоевропейской семьи, распространённый на Северном Кавказе. Этот язык является родным для по меньшей мере 550 тыс. человек и обладает долгой письменной традицией: так, литературный корпус осетинского языка содержит около 12 млн словоупотреблений. Тем не менее, до недавнего времени для осетинского языка не существовало инструментов контекстной морфологической классификации. Эта задача состоит в определении для словоформы её части речи и грамматических признаков (таких как число или падеж) с учётом контекста и является незаменимым уровнем разметки языковых корпусов.
В докладе будет описано создание обучающего корпуса с морфологической аннотацией в системе Universal Dependencies версии 2 (Nivre и др., 2020). Будут рассмотрены вызовы, которые типологические особенности осетинского ставят перед универсальными конвенциями аннотации, и расширения системы UD, принятые в ответ на них. Наконец, будет представлена первая в истории языковая модель архитектуры BERT (Devlin и др., 2019) для осетинского языка и морфологический классификатор на её основе, а также результаты экспериментов, проведённых в ходе создания и улучшения этих моделей.
Литература:
1. Devlin, Jacob и др. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. URL: https://arxiv.org/abs/1810.04805v2
2. Nivre, Joakim и др. (2020). Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection. URL: https://arxiv.org/abs/2004.10643
Post #513
249
- 👨💻 1