Ваши модели тратят более 80% средств на чтение и запись в кэш, тогда как реального нового контента они производят очень мало. Это не обман, а реальное устройство работы с LLM. Каждый ваш запрос в сессии отправляет всю историю переписки.
Это нужно просто принять и оптимизировать: плагины Caveman, context mode, RKT и другие подобные инструменты, которые влияют на размер выдачи.
🔗 Источник исследования
#AI
Post #255
2.42K

- 👎 9
- 👍 5