🔍🤖 Я собрал пример, где модель проходит несложный квиз, кликая по кнопкам, а в конце выдавая себя за требуемого человека. Работает это так:
1️⃣ Скрипт запускает специальный браузер для QA, который умеет помечать все доступные элементы управления маленькими стикерами с буквами.
2️⃣ Пользователь вводит цель. В моем случае я вводил "
Реши квиз от моего имени. Меня зовут Константин."3️⃣ Затем скрипт делает скриншот и отправляет его в GPT-4V с вопросом "что делать дальше, чтобы достигнуть такой-то цели". В промпте перечислен список доступных действий - клик, ввод текста и завершение работы, когда цель достигнута.
4️⃣ От GPT приходит ответ вида {action: click, sticker: B), а скрипт выполняет это действие.
🔄 Далее пункты 3 и 4 повторяются до тех пор, пока цель не будет достигнута.
🔥 Пока работает не идеально, но потенциал по-моему огромный - от автоматизации ручного тестирования, до полностью универсального бота, который более не ограничен различными API и функциями. Сам скрипт называется vimGPT, код доступен на гитхабе. (Но пришлось его допиливать, чтобы оно хоть как-то завелось).
P.S. Как вы понимаете, способности модели ограничены возможностью распознавать картинку, а не сложностью вопросов в квизе.