За последние несколько недель я чётко понял, что на пути к быстрому запуску микропродуктов, которые под капотом используют LLM’ки, есть две большие, пересекающиеся между собой проблемы:
❓ Сложно понять, где граница применимости разных AI-моделей.
🎯 Неочевидно, как подобрать максимально хорошие цепочки промтов для решения конкретной задачи.
Кажется, что первым шагом на пути к решению обеих проблем является возможность быстро и эффективно оценивать промты. Поэтому, в рамках одной из задач, которые я решал, попробовал быстро собрать инструмент для оценки разных вариантов постановки задачи LLM’кам. Но не особо преуспел — слишком много нюансов, слишком много корнер-кейсов, а ещё надо заниматься каким-то другим большим и сложным продуктом вместо того, чтобы делать простой и маленький.
Решил поискать что-нибудь готовое. Спросил у Perplexity, какие тулы есть для промт-инженеров. Ведь если уже появилась целая отдельная профессия, то наверняка есть и специальные сервисы. Оказалось, что действительно есть много инструментов: кто-то умеет версионировать промты и проксировать запросы к LLM’ке, кто-то предлагает Prompt IDE или CMS (так и не понял, это одно и то же или нет), кто-то пытается улучшать промты с помощью AI.
Из того, что нашлось, больше всего по описанию мне понравилась Agenta. В ней есть всё, что мне хотелось получить:
🛠 Инструменты для тестирования промтов, включая Chain of Prompts и RAG.
🤖 Автоматическая оценка результатов, в том числе на смысловую схожесть, плюс разметка вручную через удобный интерфейс.
🌐 Проксирование запросов в LLM для использования актуальных версий промтов.
⚙️ API-доступ к последним версиям промтов для использования в своих запросах.
Честно, я пока не пробовал, но звучит многообещающе. А у вас был опыт работы с инструментами для подбора промтов? Посоветуете что-нибудь?
━━━━━━━━━━━━━━━━
P.S. Кстати, в том проекте, с которого начались мои поиски инструмента, надо было оценивать результат обработки не текста, а картинки. И вот под эту задачу я так ничего готового и не нашёл. 🤷♂️
Post #115
356