Это не только хороший качественный RL и post-training.
Лично для меня самое знаковое, это что в 3.8 появился официальный
reasoning_effort={low, medium, xhigh}, причём с xhigh default.Также по сравнению с Qwen3.6-27B, где output рекомендовали выставлять в 32768 tok для обычных задач и 81920 для сложных - в 3.8 уже прямо говорят про 262144 ток.
Т.е. фокус на агентов не просто с контролем "а сколько думать", но и действительно чтобы они выдавали как можно больше полезного контента.
Конечно же, старые добрые
chat_template_kwargs с enable_thinking и preserve_thinking из чат-шаблона не выкинули, так что не забывайте про эти параметры тоже.Ну и сразу вангую, что одним из следующих небольших направлений развития будет не просто привычное сжатие контекста, а сжатие того самого ризонинга на предыдущих шагах - либо просто как обычный compact, либо более хитрые схемы с эмбеддингами/memory/прочими трюками. Кмк, это логичное развитие в сторону решения cost/gpu проблем.