Три из трех (!!!) наши статьи по исследованиям жестовых языков (РЖЯ в частности) прошли на EMNLP 2026. Это была последняя переподача, до этого было несколько реджектов на другие крупные конфы. Спасибо всем причастным, кто работал над созданием статей, особенно наших бывших коллег @karinakvanchiani @TOOFACK и @lizaforlizard ♥
О чем писали и какие ревью пришли?
🔤 Bukva: Russian Sign Language Alphabet
https://arxiv.org/abs/2410.08675
Bukva — открытый датасет изолированного дактиля (алфавита) русского жестового языка (РЖЯ). Он содержит 3757 видео (33 буквы, включая 8 динамических), записанных 155 дикторами. В качестве бейзлайнов использованы модели с модулем временного сдвига (TSM) на базе MobileNet/ResNet. Также представлено демо-приложение для обучения алфавиту.
➕ 155 участников — это огромный шаг вперед по сравнению со старыми датасетами РЖЯ (где было от 4 до 20 человек).
➕ Прозрачный пайплайн: Подробно описан процесс сбора, фильтрации и оплаты труда краудворкеров.
➕ Строгий контроль: Дикторы и валидаторы сдавали экзамен на знание РЖЯ.
➕ Качественный сплит train и test по дикторам (модель тестируется на людях, которых не видела при обучении, в других работах разбивка была случайна).
➖ Игнорирование специфики: динамическое буквы (главная фишка датасета) не оцениваются отдельно от статических.
➖ Слабые бейзлайны: Нет сравнения с современными трансформерами (за этом нам часто напихивают, но любой трансформер переобучится под этот сет)
👌 HandReader: Advanced Techniques for Efficient Fingerspelling Recognition
https://arxiv.org/abs/2505.10267
Эту статью приняли с очень высокими рейтингами:
accept, clear accept, strong acceptРабота посвящена распознаванию дактиля американского жестового языка (ASL). Мы предлагаем семейство из трех моделей (RGB, скелетные точки и мультимодальная) с новыми архитектурными блоками: TSAM (для обработки видео разной длины без паддинга) и TPE (кодировщик поз). Модель устанавливает новый SOTA на бенчмарке ChicagoFSWild+.
➕ Работа с естественными данными, независимыми от диктора.
➕ TSAM легко решает проблему видео переменной длины (без обрезки и паддинга), что экономит память.
➕ Превосходит все предыдущие методы, обученные даже на больших объемах данных.
➖ Заявляем об «экономии 50% VRAM» и «легковесности», но не приводим ни одной цифры (нет замеров FLOPs, параметров, скорости инференса или потребления памяти).
➖ Слабая мультимодальность: простое суммирование фичей RGB и скелета дает минимальный прирост, что ставит под сомнение реальную взаимодополняемость модальностей.
👩💻 Znaki: A Russian Fingerspelling Recognition Dataset
Это первый непрерывный датасет дактиля РЖЯ. В отличие от Bukva (где буквы изолированы), здесь дактиль связан во фразы (в основном имена собственные). Датасет включает 37252 видео (35.4 часа) от 68 дикторов. Краудсорсинг с двухэтапной проверкой на знание РЖЯ.
➕ Уникальность: заполняет критический пробел, отсутствие датасетов именно непрерывного русского дактиля.
➕ Исключение утечек: жесткое разделение по дикторам и фразам между train/validation/test.
➕ Разнообразие: Записи сделаны в разных условиях (не только в студии)
➖ Отсутствие побуквенной разметки: Размечены только начало и конец всей фразы, что делает невозможным обучение точной временной сегментации букв.
➖ Синтетическая природа фраз: Фразы генерировались с помощью GPT-4o
➖ Узкий охват: Только имена собственные, нет чисел, аббревиатур или естественной разговорной речи.
🌟 Общее саммари по всем трем статьям
Все работы посвящены актуальной и сложной проблеме распознавания дактильной речи (fingerspelling). Две работы (Bukva и Znaki) фокусируются на создании датасетов для русского жестового языка (РЖЯ), который исторически страдает от нехватки данных, в то время как третья (HandReader) предлагает архитектурные улучшения для американского жестового языка (ASL).
Ну и главный плюс — работы в opensource! 🖥
#release #emnlp2026 #conference