Google представил новый инструмент. Это специализированная модель, построенная на базе Gemini 2.5 Pro, которая умеет взаимодействовать с графическими интерфейсами так же, как человек: кликать, скроллить, печатать и заполнять формы.
Работает так: получает скриншот и задачу -> анализирует -> генерирует действие (клик, ввод текста) -> выполняет его -> получает новый скриншот и повторяет.
В модель встроены защитные механизмы. Для потенциально опасных действий (например, совершение покупки) система запрашивает подтверждение пользователя.
Модель уже доступна в режиме превью через Gemini API в Google AI Studio и Vertex AI.
https://ai.google.dev/gemini-api/docs/computer-use
https://cloud.google.com/vertex-ai/generative-ai/docs/computer-use
Еще из интересного в новости, что команда Google уже использует его для "починки" упавших UI-тестов, значит инструмент сначала был разработан для внутреннего пользования.
Мое внимание привлек этот тул тем, что потенциально выглядит "заменой" Zennoposter еще и от Google.
Update: Про скрин я не так понял из статьи, оно само использует скрины под капотом. Тут можно поиграться: http://gemini.browserbase.com/
Пока из интересного, что он решает рекапчу и даже ХОРОШО. Отмечает везде правильно!
Вижу кейс с решением капч через Computer Use...
