Новости по GPTChat затмили остальное происходящее. Совсем незаметно (особенно в русскоязычной сети) промелькнула новость от Microsoft о создании генератора текст-в-речь на основе AI.
Вроде бы чему удивляться, но фишка в том, что для обучения хватает 3-секундного ролика с голосом. Microsoft не хочет продукт выводить в мир (опасный, мошенники возьмут на вооружение однозначно) но интересен сам факт таких возможностей. Пока это англоязычное - кто хочет послушать - есть демо
Какие напрашиваются выводы ?
- Все равно кто-то повторит это, выкатит на рынок, сделает версии на других языках ( оригинал обучили на 60 тыс. часов английских аудиокниг)
- Почему хватает 3 секунд оригинала? Сеть обучается не говорить, а обучает интонации, тембр голоса и т.д.
- Фактически можно сказать, что уже существуют универсальные движки генерации речи высокого уровня, раз уж перешли на обучение интонациям.
- В технологиях AI на некоторые косточки скелета уже начинает нарастать мясо.
Где применять?
- запись видео-роликов станет скоро сборочной линией, сразу вспоминается Vanessa Automation, только станет возможно записывать со своим (или чужим, но приятным) голосом
- использование в тренажерах (например изучение иностранного языка, проверка произношения)
- автопереводчик на иностранный язык со своим голосом
#AI
Post #38
348