Post #30
393

Всего три недели назад было опубликовано видео где Gemini 1.5 pro скармливают запись экрана с работой в браузере (что стало возможно благодаря контекстному окну в 1млн токенов), а LLM пишет Selenium код повторяющий действия пользователя. Только мы успели с коллегами обсудить, что похоже эта технология сильно ударит по классическим решениям Robotic Process Automation (это когда рутинную работу человека типа ручного ввода чеков и т.д. заменяют скриптом, как правило что-то связанное с устаревшими ИТ решениями, которые сложно обновить), а уже вчера я наткнулся на стартап с похожим решением backed by Y-Combinator! Набор агентов для типовых действий, которых можно обучить на нужные именно вам операции. Не уверен, что у них все по-честному работает, но если да - скорость от появления технологии до появления продукта на рынке поражает. Может именно таким подходом со временем можно будет натренировать и агента-программиста, который бы брал таск из Jira, писал по нему код, коммитил и закрывал задачу?