Делюсь своим подходом. Генережка визуального контента - одна из тех областей, где можно реально упороться, пытаясь добиться ожидаемого результата. И, исходя из моего опыта, пути здесь два:
1. Следовать официальным гайдам и искать свои фишечки
Такой есть, например, для Veo 2 и для Midjourney. Способ хороший, рабочий, но требует инвестиций времени. Ибо каждый раз надо сидеть и думать: как описать сцену, объект, как лучше передать атмосферу и.т.д. В целом, это имеет смысл, если вы - какой-нибудь AI Artist и делаете визуалы на заказ, которые потом все равно дорабатываете в редакторе. Мне лично такая история не подходит
2. Использовать LLM-managed workflows
Это тот подход, в эффективности которого я неоднократно убеждался на практике. Прежде всего, когда мы делали автоматизацию создания рекламных креативов для одного из стартапов. Все генераторы на входе все равно используют LLM, преобразуя ваш запрос в язык, понятный модели. Поэтому лучше всего будет заставить LLM генерить нам промпт для нашего визуала. И здесь есть несколько хаков, которые я использую.
- Во-первых, генерим промпты с помощью LLM, которая с большей вероятностью используется для расшифровки нашего запроса в визуальной модели. Для Imagen 3 и Veo - это Gemini, для Dall-E и Sora - это GPT, для Midjourney - в целом, удавалось добиться хороших результатов и с OpenAI и c Gemini, но в идеале надо искать модельки от одного вендора.
- Во-вторых, просим не просто сгенерировать промпт чего-то, а даем few-shot примеры. Примеры можно брать разные, в зависимости от ваших целей. Например, когда мы делали рекламу - для продукта или услуги обычно используются крупные планы того, что рекламируется, с каким-то ярким впечатлением или эмоцией. Для примеров мы написали несколько таких промптов, по которым сгенерировали те изображения, которые нас устроили. Получился запромченый под определенную задачу ИИ-ассистент.
- В-третьих, используем примеры от разработчиков в качестве few-shot примеров. Они есть в гайдах выше. Кто, как не разработчики самих моделей, знает, как правильно их промптить? 🙂 Если нам нужны промпты для широкого круга задач - набираем примеров из гайдов, штук 5-6, максимально разных, чтобы избежать ситуации, когда нам, например, генерятся только видео в анимационном стиле.
- В-четвертых, инструкции из гайдов переносим в промпт.
Вот такое тело промпта я использую для VEO 2 в Gemini:
You are a world-class prompt engineer specializing in creating prompts for text-to-video tools such as Google Veo 2 and Kling. Your job is to create the best possible prompts for video generation based on a user-provided description in natural language.
The following elements can be included in your prompt:
Subject: The object, person, animal, or scenery that you want in your video.
Context: The background or context in which the subject is placed.
Action: What the subject is doing (for example, walking, running, or turning their head).
Style: This can be general or very specific. Consider using specific film style keywords, such as horror film, film noir, or animated styles like cartoon-style render.
Camera motion: Optional: What the camera is doing, such as aerial view, eye-level, top-down shot, or low-angle shot.
Composition: Optional: How the shot is framed, such as wide shot, close-up, or extreme close-up.
Ambiance: Optional: How the color and light contribute to the scene, such as blue tones, night, or warm tones.
How to handle negative prompts:
Avoid instructive language or words like "no" or "don't." For example, instead of "No walls" or "Don't show walls,"
Describe what you don't want to see. For example, use "wall, frame" to indicate that you don't want a wall or a frame in the video.
Few-shot answer examples: [сюда вставляем примеры]
Answer in English, sending only the prompt text.
Пишем простым текстом или даже просто наговариваем, что нам надо, получаем промпт. Практически всегда выходит отличный результат с первого раза.
#обучающиематериалы