📦 AI-агенты в маркетплейсах: опыт команды Яндекс Маркета
В начале ноября ребята из службы Поиска и диалоговых сценариев Яндекс Маркета выкатили обновлённого AI-агента. В карточках выше показываем, как он устроен, а ниже делимся инсайтами, которые наши инженеры получили во время разработки. Передаём слово Олегу Найдину, руководителю команды.
🅰️ Проводите хакатоны и привлекайте больше промпт-инженеров
Как только вы допилите реализацию базовых вызовов API и промптов — начинайте активно искать и привлекать промпт-инженеров для экспериментов. Их работа крайне важна для прототипирования: так вы сможете быстро переработать продуктовое ТЗ в инструмент, который будет устойчиво давать качественные ответы.
🅰️ Будьте осторожнее с промптами
Для масштабирования LLM-решений очень важно формулировать задачи, отталкиваясь от интегральной базовой технологии, а не от каждого нового среза в отрыве от предыдущих. Когда модель больше не может следовать базовым инструкциям, это значит, что пора остановиться. Если продолжать усложнять инструкции, возможна ситуация, когда промпт перегрузят минорными правками и нейросеть перестанет его понимать.
🅰️ Создавайте замеры качества. Итерируйте базовое качество и UX как можно чаще
Собирайте большие корзины запросов, которые репрезентативны ожидаемому потоку обращений к AI-агенту. И продумывайте подробные метрики качества, иначе двигаться в быстрых итерациях будет очень сложно. Бывают полезны как поточечные метрики качества (например, бинарная допустимость или недопустимость ответа по ряду продуктовых критериев), так и side-by-side-сравнения ответов.
Когда у вас появятся измерения, которым вы доверяете, начинайте часто итерировать качество ответа агентов и выбирайте лучшие подходы. Это поможет вам быстрее приступить к непосредственному внедрению в продакшен.
🅰️ Вкладывайтесь в инфраструктуру
Скорость и надёжность — очень важные продуктовые метрики. Пользователи не хотят долго ждать. Сразу добавьте поддержку постепенной генерации ответа, чтобы пользователь видел его по чанкам. Иначе придётся переделывать весь проект на ходу. А это долго, дорого и больно (поверьте нашему опыту). Мы советуем использовать квантизацию весов и спекулятивный декодинг для ускорения генерации ответов.
🅰️ Используйте мультиагентные фреймворки
Они помогают быстро итерироваться и тестировать разные пайплайны обработки запросов — так вы быстрее поймёте, как должен и может выглядеть конечный продукт. Плюсы и минусы разных решений ищите в карточках выше. Кстати, советую присмотреться к Yandex AI Studio!
🅰️ Специализируйте модели под домен, если это возможно. Поддерживайте баланс между AI-монолитом и AI-микросервисами
Дообучайте модели под конкретную задачу. В зависимости от возможностей можно использовать prompt-tuning, LoRA или полноценную связку SFT+RLHF. Это обеспечит больший контроль и качество результата, а ещё позволит использовать меньшие модели. Так вы сможете сэкономить вычислительные ресурсы и увеличить скорость генерации.
➕ Есть и альтернативная точка зрения. Некоторые исследователи считают, что, по закону Мура, вычисления заметно подешевеют в ближайшем будущем. И поэтому можно увеличивать размеры моделей, растя качество их ответов, не сильно переживая о стоимости GPU и скорости работы.
Эта позиция не лишена смысла, но мне кажется, что мир ещё не совсем готов к этому. На мой вкус, если можно дообучить модель под конкретную задачу, то лучше так и сделать.
Подписывайтесь:
💬 @Yandex4Developers
Post #1393
10.6K




- ❤ 12
- 🦄 5
- 🔥 4
- 🗿 3
- 👾 3
- ☃ 1
- 👍 1