Когда компания начинает на корпоративном уровне внедрять ИИ, она, с одной стороны, экономит трудочасы, а с другой возникает новая статья расходов - оплата лицензий и токенов для ИИ сервисов. Зрелые компании мониторят использование токенов пользователями и составляют инструкции по их разумному потреблению.
Итак, что нужно делать, чтобы снизить стоимость ответов LLM:
🎙Работайте в автоматическом режиме выбора модели
Не применяйте думающую модель там, где не требуется глубокий анализ - это как забивать гвозди микроскопом. Задача будет решена слишком высокой ценой.
🎙Ограничивайте объём ответа
Рекомендую заранее задать рамки результата.
Примеры формулировок:
«Ответ в 3–5 пунктах»
«До 120 слов»
«Только финальный ответ, без рассуждений»
«Верни только JSON, без пояснений»
🎙Перестаньте флиртовать с ИИ
Модели не нужен канцелярит и приветствия. Каждое лишнее слово — это токены.
Вместо «Привет, можешь, пожалуйста, подробно…» → «Сделай: …»
🎙Используйте структуру вместо текста
Короткий шаблон экономит токены и снижает шанс неправильного понимания:
Роль: <кто ты>
Задача: <что сделать>
Формат: <как вывести>
Ограничения: <длина/стиль/что исключить>
Вход: """..."""
🎙Не дублируйте контекст
Если контекст уже есть в диалоге — не переписывайте его.
Достаточно: «Используй предыдущий контекст. Новое: …»
🎙Сужайте запрос
Один «монстр-промт» часто дороже, чем 2–3 коротких шага.
Пример пайплайна:
«Составь план из 6 пунктов.»
«Раскрой пункт 3 (100–150 слов).»
🎙Минимизируйте примеры
Примеры — самые дорогие токены: используйте не более одного короткого примера
🎙Сжимайте большие входные данные
Если надо обработать лог/текст/таблицу — сначала сожмите файл, потом работайте с краткой версией. Если нужно проанализировать таблицу xlxs или pdf, лучше скормить ее в формате csv или xml
🎙Запрещайте лишнюю глубину
Если не нужна лекция — это надо явно сказать:
«Без исторической справки»
«Не объясняй базовые термины»
«Без примеров»
«Сразу к сути»
🎙Просить уточнения одним блоком
Чтобы модель не растягивала диалог:
«Если данных не хватает — задай до 3 вопросов одним сообщением.»
🎙Делать компактные разделители
Короткие кавычки/теги лучше длинных вводных:
✔️Вход: """..."""
❌ «Далее приведён текст, который нужно тщательно…»
🎙Запрещайте повторения
Модель часто пересказывает условие. Это лишние токены.
Используйте фразы:
«Не повторяй задачу»
«Без перефразирования входа»
«Сразу ответ»
🎙Для серийных задач — один раз задайте правила, дальше только данные
Один короткий «системный» стиль → потом дешёвые запросы.
Пример:
Правила (1 раз): «Всегда отвечай 5 буллетами до 15 слов.»
Далее: «Вход: """новый текст"""»
🎙Требования — через параметры
Вместо длинного описания желаемого ответа:
«Тон: нейтральный. ЦА: менеджеры. Цель: решение. Формат: 6 буллетов.»
P.S. С некоторыми людьми, иногда, хочется применить те же правила 😁
