⚡️ WORLD INTEL BRIEF
• 🔬 Исследование 35 000 запусков кодинг-агентов показало: с Qwen сжатие контекста до трети исходного объёма увеличивало время выполнения на 20–80%, а число обращений к модели — на 10–27%. Одинаковая политика дала разные результаты на разных моделях: одна из настроек снизила успешность Devstral до 38,7% и одновременно замедлила работу. arXiv
↳ Экономия токенов у агента не гарантирует снижения задержки и стоимости.
—
📡 @azalio_tech_summary
Post #9799
26