ИИ заговорил как человек, но с одним забавным изъяном
Google выкатил Gemini 3.1 Flash Live с упором на гиперреалистичный синтез речи. Модель выносит конкурентов в Big Bench Audio (ответила голосом на 1000 вопросов без запинки) и отлично держит контекст диалога на разных языках.
Но есть нюанс. В тесте на обработку прерываний и шумов (Scale AI MultiChallenge) суперсовременная нейронка набрала жалкие 36.1% при средних по палате 50%.
Практический вывод: если робот-оператор начнет вас бесить — просто громко кашляйте в трубку и перебивайте его. Он сломается.
От дипфейков нас пока спасет вшитый в аудио водяной знак SynthID, а пощупать модель руками скоро можно будет через API Gemini и AI Studio.
Готовы внедрять таких болтунов в свои продукты?
🔥 Заверните, уже пишу интеграцию
🥺Слишком крипово, я за олдскульный текст
😃 Пусть сначала научатся понимать невнятное ТЗ от заказчиков
#AI #LLM #GenAI
(источник)
Post #329
69

- ❤ 2