Чат с агентом живёт третий час. Ответы приходят медленнее, токены тают всё быстрее, агент всё больше тупит... Было? 👀
Причина такого ухудшения: модель не помнит разговор. Каждое новое сообщение отправляет ей всю переписку с самого начала. "У тебя тут строки склеились" — вроде пять слов, но эти пять слов улетают в агента заново со всей историей чата. Кредиты тратятся на ровном месте.
В Kodik есть две фичи, которые помогают лучше работать с контекстом: кеширование и сжатие. О них под катом:
• Кеширование — это "договорённость" с провайдером: он запоминает уже обработанное начало диалога и не считает его входными токенами. Кешированный ввод стоит в разы дешевле, токены приходят быстрее. Работает, пока начало не меняется: переключили модель или открыли новый чат — кеш сгорел.
• Сжатие действует с другого угла. У контекста есть потолок (например, 1 миллион токенов), история в него упирается. Раньше в этот момент старые сообщения просто отваливались: агент забывал договорённости из начала чата и уверенно переписывал то, что полчаса назад просили не трогать. Kodik же умеет сворачивать раннюю часть диалога в конспект и работает дальше с ним.
Получается двойственная ситуация. Начинать новый чат каждые двадцать минут — выбрасывать готовый кеш и платить за него повторно. Тащить один чат всю неделю неделю: конспект остаётся конспектом, детали и обновления в нём тонут. 🤔
Подсветим для вас общее правило, которое можно сформулировать так:
Новая задача — новый чат, в рамках задачи — один.
Kodik оптимален как в первом сценарии, так и во втором. Пробуйте. 😉
