1. روش مبتنی بر کنترل کاربر مثل مدل Qwen3
در این رویکرد، تصمیمگیری درخصوص میزان استدلال مورد نیاز به کاربر سپرده میشه. مدل از طریق علائمی مانند
/thinkو
/no_thinkتشخیص میده که پاسخ باید شامل استدلال چند مرحلهای باشه یا خیر.
با این روش، کاربر در تعیین سطح پاسخ نقش مستقیم داره. برای آموزش مدل، از مجموعه دادههایی شامل نمونه های دارای هر دو نوع پاسخ (ساده و تحلیلی) استفاده شده و از طریق fine-tuning، قابلیت تطبیق ایجاد میشه.
2. رویکرد مبتنی بر بهینهسازی هزینه،فایده مدل AdaCoT (توسعهیافته توسط ByteDance)
این روش از الگویی شبیه به تحلیل اقتصادی بهره میبره، مدل سعی میکنه با صرف حداقل منابع محاسباتی، حداکثر دقت پاسخ رو فراهم کنه. در ابتدا، داده ها برچسب گذاری میشن تا مشخص شه کدوم پرسش ها نیاز به تفکر دارن. سپس مدل از طریق fine-tuning و یادگیری تقویتی با معیارهایی مانند دقت پاسخ، اجتناب از تفکر غیر ضروری، و صرف زمان بهینه آموزش میبینه. برای رسیدن به این هدف، از روشهایی نظیر Selective Loss Masking استفاده میشه.