Коллеги из Сбера опубликовали на Хабре кейс: «Как мы научили GigaChat слышать».
Из главного, для повышения качества распознавания перешли на end-to-end архитектуру вместо связки ASR + LLM. И если раньше голосовой запрос шёл через распознавание речи и преобразование в текст, то сейчас GigaChat Audio сразу распознаёт речь. В side-by-side сравнении на 1200 диалогах набрал 0,68 против 0,32 у прежней схемы. Вместе с этим увеличилась и длительность контекста до 170 минут аудио в одном запросе.
Новый GigaChat Audio достиг уровня GPT-4o. Субъективная оценка диалоговых возможностей на русском языке состояла из семи критериев: общее впечатление, красота, грамотность, следование system, контекстность, полезность и фактология.
Протестировать слух нейросети уже можно в веб-версии giga.chat и в боте @gigachat_bot.
Post #651
4.25K

- ❤ 21
- 👍 10
- 🔥 5
- 🌚 2
- 🙊 2
- 😁 1
- 🤝 1