راهنمای عملی Qwen3.8-27B: عمق استدلال را کنترل کنید و زمینه را تا 1 میلیون توکن گسترش دهید
reasoning_effort — عمق استدلال را بر اساس هر درخواست، کم یا زیاد کنید.
زمینه فوقالعاده طولانی — 262 هزار توکن به صورت بومی، قابل گسترش تا 1 میلیون با YaRN.
1. reasoning_effort: کنترل عمق استدلال بر اساس هر درخواست
xhigh (پیشفرض): برای کارهای پیچیدهای که نیاز به تحلیل کامل دارند.
medium: برای ایجاد تعادل بین دقت و سرعت.
low: برای استدلال کارآمد که سرعت و هزینه را در اولویت قرار میدهد.
2. پردازش زمینههای فوقالعاده طولانی: 262 هزار بومی، تا 1 میلیون با YaRN
فریمورکهای متنباز YaRN ایستا را پیادهسازی میکنند — عامل مقیاسگذاری بدون توجه به طول ورودی ثابت میماند، که میتواند عملکرد را در متون کوتاهتر کاهش دهد. YaRN را فقط زمانی فعال کنید که واقعاً به زمینههای طولانی نیاز دارید.
عامل را با طول زمینه معمول خود تنظیم کنید. اگر حجم کاری شما معمولاً حدود 524,288 توکن است، عامل را به جای 4.0 روی 2.0 تنظیم کنید.
آن را به روش خود مستقر کنید
vLLM: https://recipes.vllm.ai/Qwen/Qwen3.8-27B
SGLang: https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B
TokenSpeed: https://lightseek.org/tokenspeed/recipes/models#qwen3-8
Unsloth: https://unsloth.ai/docs/models/qwen3.8
— Qwen Developers
🔗 https://x.com/QwenDevs/status/2088289608031510811
Post #11
325