На прошлой неделе Google презентовали Gemini 2.0 с потрясающей возможностью в режиме реального времени общаться с моделью через видео или шарить модели рабочий стол. Готовим пример с программированием с Gemini 2.0, а пока короткий видеодиалог. Впечатляет и способ общения, и что модель точно распознает не самые стандартные предметы, и знает что с ними делать.
Думаю, у этой технологии будет много применения. Самый простой пример - приложение для слабовидящих Be My Eyes – в котором волонтеры подключаются по удаленной видеосвязи и помогают слабовидящим разобрать что за предметы перед ними.
Ложка дёгтя: повторял этот эксперимент в разное время и обнаружил, что в момент большей нагрузки на сервера (в дневное время в Штатах) Gemini отвечает хуже, например таймер помидор в такие часы она принимала за обычный помидор и предлагала его съесть.
Open AI в ходе своих 12 анонсов вслед за Google тоже презентовали потоковое общение с моделью, обещают, что скоро будет всем доступно. А также запустили Projects в ChatGPT - по сути, это папки, в которые вы можете складывать диалоги, сортировать их по темам, чтобы они не шли бесконечной лентой слева экрана.
Post #202
1.21K
