По истории агента почти не видно, когда сжатие контекста его сломает 😌
6 октября исследователи Salesforce проверили, можно ли выбирать безопасный момент для compaction по недавним действиям агента.
Они взяли 590 границ сжатия из AppWorld и переиграли каждую двумя способами: с полным контекстом и с его summary. Вредом считались ошибки и повторные вызовы инструментов после сжатия.
Лучший предиктор показал всего 0,66 AUROC. Простое интерпретируемое правило предотвращало 21% вредных сжатий, сохраняя 84% возможностей освободить контекст. Это лишь на 4,4 процентного пункта лучше случайного выбора при той же частоте сжатия.
Для тебя вывод: эвристики вроде «сжимать после завершения этапа» или «не сжимать после ошибки» выглядят разумно, но пока слабо предсказывают реальный ущерб. Compaction лучше считать миграцией состояния: отдельно сохранять план, результаты действий и нужные переменные, а качество проверять парными replay-тестами.
Ограничение: исследование охватывает одну модель, один компрессор, AppWorld и окно в 4096 токенов. С обычным порогом по числу токенов метод корректно не сравнивали.
Исследование от 6 октября 2026 года
#aiagents #contextengineering #compaction #agentmemory #llmops #aievals
@data_engi
Post #1404
48