ИИ-агенты и роевые системы: что это такое и зачем они нужны?
От каждого смарт чайники сейчас слышно: ИИ-агенты, ИИ-агенты, ИИ-агенты... Предлагаю уже наконец-то разобраться, что это такое, чем отличается от обычного ChatGPT и зачем оно вообще нужно нам в работе.
В чем разница между ChatGPT (LLM) которым вы пользуетесь на сайте и ИИ-агентом?
Обычная языковая модель (LLM) - это просто умный собеседник. Вы задаете вопрос - она выдает текст. Она не может сама пойти в интернет, скачать отчет, проанализировать его и отправить письмо коллеге.
А вот ИИ-агент - может.
На самом деле это тот же ChatGPT, которому "приделали руки". LLM выступает в качестве мозга, вызывает прочие инструменты, обрабатывает полученные от них результаты пока не решит задачу которую поставил пользователь.
Но просто дать доступ к инструменту недостаточно, нужно перестроить принцип того как нейросеть работает.
Когда агенту ставиться вопрос или задача, он не отвечает вам сразу. Он идёт смотрит какие у него есть инструменты и инструкции по тому как нужно отвечать, какой инструмент для чего используется. Затем на основе всей этой информации агент создаёт план того как он будет решать поставленную задачу:
- Подготовить запросы к поиску
- Запустить инструмент "Поиск в интернете",
- Дождаться окончания работы инструмента
- Проанализировать информацию и принять решение достаточно ли её,
— Если недостаточно вызвать "Поиск в интернете" с другими параметрами
— Если достаточно сформировать ответ пользователю
Как видите план является скриптом, тут нужно не просто дать ответ пользователю, а выполнять последовательно ряд действий, с паузами и разветвлениями.
Сама нейросеть не может выполнить подобное, поэтому нужна система которая будет дирижером. Для этого используется специальное ПО: Cursor, N8N и масса других. А выполнение плана, это просто большое количество запросов к LLM.
Вы пишите запрос в Cursor -> он берёт ваш запрос и добавляет к нему ещё инструкцию, как именно нейросеть должна написать ответ -> получает от LLM скрипт и запускает его -> каждый пункт плана запускает инструменты или делает новое обращение в LLM -> Cursor всё это компилирует отдаёт всё что было получено в LLM пока она не скажет всё ок вот ответ - > выводит ответ пользователю.
Это уже сложный процесс, со множеством проблемных зон, но все они уже решены за вас и тот же cursor работает прекрасно для написания кода, а Claude Cowork - идеален для повседневных задач.
Например у меня рекламу в Яндекс Директ полностью ведёт Claude Cowork. Я его запускаю мол проанализируй, что там с РК, он заходит на сайт, проводит аналитику, и дает ответ: вот эти ключи плохие, а эти объявления перестали работать, вот предложения, что нужно поправить. Я соглашаюсь с ним и даю разрешение на исправление его замечаний. Он начинает делать новые объявления, менять ключевые слова. Ну сказка же) Ток это давно реальность. Мало того, что это экономит несколько часов моего времени, так он ещё и делает это лучше меня)
Хорошо, но это всё ещё какие-то отдельные задачи, отдельного человека. А можно ли целиком выстроить процесс который заменит человека?
Да, для этого используется MAS(Multi-Agent Systems) ещё называю Рой (рой агентов).
В целом из названия понятно, что это: множество узкоспециализированных ИИ-агентов которые общаются между собой для решения сложной задачи.
Как это выглядит на практике (например, в HR-отделе):
1️⃣ Агент-Оркестратор принимает от вас заявку на поиск разработчика.
2️⃣ Агент-Парсер идет на работные сайты и собирает резюме.
3️⃣ Агент-Скринер анализирует их и отбирает топ-5 самых релевантных.
4️⃣ Агент-Координатор связывается с кандидатами в Telegram и назначает слоты в календаре.
Post #166
64

- 😈 1