Наша цель — добиться «присутствия голоса» — того волшебного качества, благодаря которому разговорное взаимодействие кажется реальным, понятным и ценным. Мы создаём партнёров по общению, которые не просто обрабатывают запросы, а ведут подлинный диалог, который со временем укрепляет доверие и уверенность. При этом мы надеемся реализовать неиспользованный потенциал голоса как важнейшего интерфейса для обучения и понимания... Мы верим в будущее, в котором компьютеры можно будет назвать живыми. Они будут видеть, слышать и сотрудничать с нами так, как мы привыкли. Естественный человеческий голос — ключ к открытию этого будущего.
С инженерной точки зрения голосовая модель Sesame также интересна — она состоит из семантических лексем, компактных диктор-инвариантных представлений семантических и фонетических признаков, и акустических лексем, кодирования тонких акустических деталей, с помощью векторной квантизации, позволяющие сохранить естественные характеристики речи, такие как индивидуальность и тембр.
Мы немного поговорили с ботом и полагаем, что иллюзия общения оборачивается иллюзией со-присутствия, которая ставит под вопрос в принципе наше представление о речи как исключительной прерогативе человека. Когда машины обретут понятный голос (уже разговаривая на лишь им понятных протоколах и кодах), возможно технофобии станет немного меньше.