Допустим, агент уже написал код, потратил токены, запустил инструменты и объяснил, почему выбрал именно такое решение.
А что от всей этой работы останется через месяц?
Оказывается, у каждого CLI-харнесса свой ответ:
- один пишет аккуратный JSONL, который можно открыть обычным
tail- другой складывает историю в SQLite
- третий сохраняет reasoning открытым текстом
- четвертый шифрует его, но хотя бы оставляет summary
- пятый записывает токены, но не деньги
- шестой вообще не ставит версию формата, поэтому сторонние парсеры узнают об изменениях уже после поломки
Так появился Session-Bench: я сравнил форматы сессий десяти CLI-агентов по 19 критериям.
https://jazzyalex.github.io/agent-sessions/bench/
