Про ИИ-агентов
Вообще следующим постом планировалась завершающая часть серии про HFT, но в воскресенье со мной произошел интересный случай, который я посчитал достойным отдельного поста. На заднем фоне рилсы не крутятся, поэтому для удержания внимания буду писать короткими пунктами:
▪️разряженный за ночь ноутбук перестал загружаться после ввода пароля (шкала загрузки застревала на ~10%), простая перезагрузка не помогла. Для меня случай нестандартный, потому что раньше проблемы с ноутбуком (в основном неожиданные зависания) я решал, запуская Codex с промптом типа "у меня тут такая-то штука грузится дольше обычного, проведи всю диагностику и реши вопрос", а тут Codex запустить нельзя. Но ноутбук-то рабочий, поэтому была сильная мотивация разобраться до понедельника.
▪️иду в ChatGPT с телефона, описываю ситуацию текстом с прикрепленными фотографиями экрана ноутбука. Он последовательно дает мне всякие рекомендации по перезагрузке и диагностике, чтобы локализовать проблему (оказывается, из режима восстановления macOS можно даже открыть терминал!). По очереди все пробую, все проверки/диагностики проходят зелеными, но рабочий стол все равно не загружается
▪️в какой-то момент ChatGPT предлагает поставить на тот же диск отдельную чистую macOS, чтобы проверить, правда ли проблема в основной системе. Я ставлю тестовую macOS, рабочий стол на ней открывается без проблем
▪️ChatGPT предлагает дальше продолжать что-то пробовать и руками проверять очередные гипотезы, но я понимаю что раз я попал на рабочий стол (пускай и в другой системе), то могу с него запустить Codex. Спрашиваю ChatGPT может ли Codex из тестовой macOS получить доступ к основной системе и что-то там сделать, ChatGPT говорит что да. Уже предвкушаю победу
▪️запускаю Codex из тестовой macOS, описываю ситуацию, прошу разобраться. И он реально разбирается! Сам собирает диагностику, отбрасывает несколько правдоподобных гипотез и в итоге находит старую временную папку, которую оставил тестовый запуск скрипта по совсем другой задаче. В ней было огромное количество каталогов, и при загрузке системный процесс часами пытался удалить это дерево и блокировал запуск основной macOS
▪️главная ирония в том, что скрипт, оставивший эту папку, тоже был написан Codex'ом. В итоге он сначала создал проблему, которую без него я бы почти наверняка не нашел, а потом сам же помог ее диагностировать и устранить - современные проблемы требуют современных решений
Самое интересное тут даже не то, что Codex оказался умнее ChatGPT: ChatGPT с телефона мог только говорить мне, что проверять, а Codex из тестовой macOS получил терминал, доступ к дискам и возможность самому собирать факты, проверять гипотезы и менять план. То есть разницу между полезным советчиком и агентом, который реально решает задачу, в этом случае создал не столько интеллект модели, сколько доступ к окружающей среде.
Выводы для себя сделал следующие:
0. Codex нашел точную причину проблемы, которую в обычном сервисном центре, скорее всего, решили бы чистой переустановкой macOS, не разобравшись, что именно сломалось (т.к. проблема была нетипичной и к тому же созданной самим Codex'ом во время работы над прошлой задачей)
1. Если долго пользовался агентами, то при их отсутствии в ситуации где они обычно доступны как будто теряешь руку и приходится справляться без нее
2. Чем раньше ты в такой ситуации придумаешь как эту руку отрастить обратно (т.е. дашь агенту возможность взаимодействовать с окружающей средой и самостоятельно делать про нее выводы, а не просто быть диванным аналитиком в диалоговом окне ChatGPT/Claude/etc.), тем лучше
3. Одним из главных боттленеков массового применения ИИ-агентов в повседневной жизни (а не написании кода для работы) является не отсутствие интеллекта, а частое отсутствие у агента возможности видеть то же, что видим мы, и делать то же, что можем сделать мы.
4. Когда кажется, что агент жестко тупит, стоит задаться тремя вопросами:
▪️знает ли он то же, что знаете вы?
▪️видит ли он то же, что видите вы?
▪️может ли он делать то же, что можете делать вы?
Если на какой-то из трех вопросов выше ответ "нет", следующий вопрос - как это исправить. Причем его, как ни странно, можно напрямую задать самому агенту. Например, в одной задаче, где была важна корректная визуализация, я устал вручную скидывать агенту скриншоты с его косяками и попросил научиться самостоятельно делать скриншоты и сравнивать их с ожидаемым результатом.
Другой пример: часть агентов получает структурированное текстовое представление веб-страницы, а не ровно ту картинку, которую видим мы, поэтому может запросто пропустить, что в выдаче есть 5 страниц: мы видим переключатель страниц невооруженным взглядом, а агенту еще нужно догадаться, где и как его искать.
Или, например, я хочу собрать корзину в приложении доставки продуктов, отправив голосовое сообщение в чат с ИИ-агентом. Пока это не внедрят как фичу внутри приложения (рано или поздно это, конечно, все сделают, но когда именно - непонятно), агенту нужен либо нормальный API или встроенная интеграция, либо возможность самостоятельно пользоваться обычным интерфейсом приложения: находить товары, выбирать нужные варианты, класть их в корзину и оформлять заказ. Первое есть далеко не у каждого приложения, а второе пока работает не всегда надежно.
Делитесь в комментариях своими нетривиальными кейсами применения ИИ-агентов в жизни и на работе, особенно теми, где агент не просто что-то подсказал, а получил доступ к среде и реально довел задачу до конца. Ну или, как в моем случае, сначала сам создал проблему, а потом героически ее решил.
#ИИ #агенты #личное
Post #91
1.25K
- 🔥 26
- ❤ 16
- 👍 6