Наверняка многие из тех, кто меня читает, хотя бы раз, да использовали распознавание речи в текст. Сегодня такие системы работают довольно хорошо для обычной речи: они научились правильно расставлять знаки препинания и даже могут учитывать контекст.
Но даже технооптимист с сомнением воспримет идею о том, что машина способна справиться с потоком математической речи (озвученных формул и математических выражений), надёжно перепаковав её в LaTeX-код — так называемая Speech-to-LaTeX задача. А ведь такая штука могла бы пригодиться, когда нужно расшифровывать аудиозапись семинара, готовить конспекты и презентации, да и просто лень ручками набирать формулу для статьи.
Лучшее, что можно ожидать от существующих разпознавалок, это строки типа «сумма по i от единицы до n», иногда они узнают отдельные математические символы типа π или знака умножения. Ситуация усложняется ещё и тем, что структура формул может обладать вложенностями (скобки, дроби и т.д.). Наконец, математическая речь неоднозначна — мы не всегда проговариваем скобки, и машина из контекста должна понять, когда их нужно ставить, а когда нет.
Как оказалось, мои коллеги из AIRI работают над проблемой Speech-to-LaTeX. Недавно они собрали большой открытый двуязычный датасет и сравнили несколько подходов к её решению. О том, как они его собирали, и насколько далеко ещё до надёжных математических распознавателей, рассказал на днях один из членов команды Дмитрий Корж в нашем блоге на Хабре.
Post #891
654
- 👍 12
- ❤ 5
- 🍾 2
- 🍓 1