Google выпустила свою улучшенную модель голоса Gemini 3.8 и я решил попробовать её на голосовом тренажере.
Помните, я писал, что сделал голосовой ИИ-тренажер для того, чтобы имитировать реальные диалоги с клиентами для менеджера по продажам.
Мой предыдущий тренажер держится на Elevenlabs — лучшей ИИ модельке для голосов. Лучшей и самой дорогой 🥲
Поэтому я все время ищу альтернативы. Попробовал Gemini и был просто в шоке от скорости. Она работает просто молниеносно. Но есть нюнс. Бляха, как всегда.
Модель каждый раз, когда мы говорим что-то "хавает весь диалог заново". Получается, такая петрушка:
Мы говорим привет. Она нам отвечает привет.
Мы говорим как дела, но модель читает "привет, + привет + как дела", то есть первая фраза из истории диалога приклеивается, чтобы модель не теряла контекст.
Но каждый токен который мы отправляем нейросети стоит денег и такой диалог становится пиздецки дорогим уже спустя три минуты диалога.
Кэширование. Есть такой прием, который позволяет закэшировать неизменную часть диалога. И не платить за нее. Или платить совсем чуть-чуть. Она есть во всех современных нейронках. Как раз чтобы не платить за токены, которые мы постоянно отправляем в нейронку. А тут их нет.
Молниеносная скорость работы. Просто посмотрите на видео. Это реально вау. Но бессмысленно, ибо дорого. Жаль.
Post #2267
474
- ❤ 4