Кто какую модель для Speech-to-Text использует?
Недавно я писал пост про Handy и рассказывал, что практически перестал печатать — теперь почти всё наговариваю. Но недавно возник вопрос: а можно ли сделать распознавание ещё лучше, просто выбрав другую модель?
До этого я по дефолту использовал Nemotron Streaming 3.5. Модель неплохая, но мне стало интересно найти лучший вариант. Спустя какое-то время мы с GPT отобрали четыре модели для сравнения: GigaAM v3, Nemotron Streaming 3.5, Parakeet V3 и Whisper Large V3 Turbo.
Тестировал так: читал текст(скину его в комменты) и сравнивал результаты
GigaAM v3 💩💩💩
Из плюсов — самая маленькая модель, около 250 МБ. На этом плюсы заканчиваются, потому что у меня она показала себя как полное говно.
Несмотря на то что модель специализирована под русский язык, даже с русской речью она справилась хуёво. А когда в речь попадали английские слова, что у любого программиста происходит постоянно, начинался полный ужас. В итоговый рейтинг даже не ставим. В целом, ничего хорошего от Сбербанка я и не ожидал, надеюсь карту можно закрыть уже в любом отделении а не "где открывали туда и приходите".
Nemotron Streaming 3.5 👍
Этой моделью я пользовался по дефолту. Ошибок было достаточно, но при диктовке больших текстов это не так страшно: из контекста обычно понятно, где именно модель накосячила. В целом качество хорошее.
Главный плюс — настоящий streaming. Ты говоришь и сразу видишь live transcription: не нужно заканчивать запись, ждать обработки и только потом получать текст. Очень приятный UX.
Parakeet V3 👍
Многие считают её лучшей моделью из всех доступных в Handy, но мне она как-то не зашла. Parakeet показала себя лучше, чем Nemotron, и тем более лучше, чем GigaAM, однако на моём голосе, манере речи и наборе терминов всё равно проиграла Whisper.
Плюс в моей конфигурации нужно закончить запись и немного подождать, пока появится транскрипция. После streaming-модели это уже ощущается как небольшой шаг назад.
Whisper Large V3 Turbo 💪💪💪
А вот это мой победитель. Модель очень хорошо распознаёт и русские, и английские слова, нормально переваривает смешанную речь, code-switching и технические термины.
Да, после записи приходится немного ждать, так же как и с Parakeet. Но итоговое качество для меня оказалось важнее streaming, поэтому пока остаюсь на Whisper Large V3 Turbo.
Мой субъективный рейтинг:
Whisper Large V3 Turbo > Parakeet V3 > Nemotron Streaming 3.5 >>> GigaAM v3.
Ещё в Handy можно собрать словарь Custom Words и добавить туда имена, названия продуктов и технические термины, которые модель постоянно воспринимает херово. Также можно подключить AI post-processing, чтобы дополнительная модель исправляла ошибки, пунктуацию и форматирование.
Теоретически можно заморочиться и с fine-tuning под собственную речь и domain vocabulary, но до такого уровня задротства я пока не дошёл.
Такие дела. Надеюсь, кому-то было полезно.
А чем пользуетесь вы? Какие приложения и Speech-to-Text-модели пробовали? Как вообще взаимодействуете с компом в 26 году?
AI Для Задротов. Подписаться.
Post #43
408

- 👍 7