https://screen.studio/share/kd4sWYwA
Экспериментальный интерфейс недели:
↓
на входе
голос (транскрибируем через Whisper)
на выходе
картинка, сгенерированная gemini-2.0-flash-exp-image-generation на основании текста + цветовая схема
Во-первых, почему бы не сгенерировать картинку из чего угодно?
Во-вторых, хочу поэкспериментировать с невербальными взаимодействиями с ИИ. кто сказал, что всё сошлось на голосовых интерфейсах? хочу переключаться между модальностями легко и просто.
все отвлеклись на gpt4o, но напоминаю — gemini-2.0-flash-exp-image-generation очень пропрывная модель
Post #157
202