۱. Tokenization (توکنیزه کردن)
توکنیزه کردن یعنی شکستن متن به واحدهای کوچکتر به نام «توکن». این توکنها میتونن کلمات، بخشهایی از کلمات یا حتی کاراکترها باشن. مدلهای زبانی برای اینکه بتونن با متن کار کنن، باید اول متن رو به توکن تبدیل کنن.
مثلاً جملهی "من عاشق هوش مصنوعی هستم" ممکنه به توکنهای ["من", "عاشق", "هوش", "مصنوعی", "هستم"] شکسته بشه. اما در مدلهای مثل GPT، که از «byte pair encoding» استفاده میکنن، ممکنه حتی کلمات هم به قطعات کوچکتر تقسیم بشن. این مرحله خیلی مهمه چون ورودی مدل فقط میتونه توکنها رو بفهمه، نه متن طبیعی رو.
۲. Embedding
بعد از توکنیزه کردن، نوبت به «Embedding» میرسه. چون مدلها فقط با اعداد کار میکنن، هر توکن باید به یه عدد یا بردار (لیستی از اعداد) تبدیل بشه. این بردارها به مدل کمک میکنن معنی کلمات رو بهتر درک کنه.
مثلاً کلمات "پادشاه" و "ملکه" ممکنه بردارهایی داشته باشن که در فضای عددی به هم نزدیک باشن، چون از نظر معنایی شبیهان. این مرحله باعث میشه مدل بتونه «معنا» رو به شکلی قابل پردازش درک کنه.
۳. Self-Attention (توجه به خود)
Self-Attention یکی از خلاقانهترین ایدهها در مدلهای زبانیه. این مکانیزم کمک میکنه مدل تصمیم بگیره به کدوم قسمتهای جمله بیشتر توجه کنه.
مثلاً در جملهی "کتابی که دیروز خریدم عالی بود"، مدل باید بفهمه که "عالی بود" مربوط به "کتاب"ه، نه "دیروز". Self-attention این وابستگیها رو مشخص میکنه. به همین دلیل مدلهایی که از این روش استفاده میکنن (مثل BERT و GPT)، درک عمیقتری از ساختار زبان دارن.
۴. Transformer
ترنسفورمر یه معماری جدید و انقلابی در یادگیری زبان طبیعیه که از مکانیزم attention برای پردازش توالیها استفاده میکنه. برخلاف مدلهای قدیمیتر مثل RNN، این مدلها میتونن همزمان تمام کلمات یک جمله رو ببینن و سریعتر و دقیقتر کار کنن.
GPT، BERT، T5، LLaMA، همه بر پایهی ترنسفورمر ساخته شدن. مثلا GPT یه ترنسفورمر «سمت چپنگره» که فقط به کلمات قبلی نگاه میکنه و کلمه بعدی رو حدس میزنه.
۵. Pretraining و Fine-tuning
مدلهای زبانی مثل GPT اول در مرحلهای به اسم Pretraining روی مقدار زیادی متن عمومی آموزش میبینن (مثل کتاب، مقاله، سایتها). این مرحله کمک میکنه زبان رو یاد بگیرن، بدون اینکه وظیفه خاصی داشته باشن.
بعداً در مرحلهی Fine-tuning، مدل برای انجام یه کار خاص آموزش داده میشه؛ مثل خلاصهسازی، ترجمه یا پاسخ دادن به سوالها. این دو مرحله باعث میشن مدل هم «دانش عمومی» داشته باشه، هم توی کار خاصی بهتر از معمول عمل کنه.
۶. Prompting و Instruction Tuning
Prompting یعنی طراحی یک ورودی مناسب برای مدل تا کاری رو انجام بده. مثلاً وقتی به مدل میگی: «لطفاً این متن رو خلاصه کن»، این یه prompt محسوب میشه.
اما Instruction tuning مرحلهایه که طی اون مدل یاد میگیره چطور به دستورات مختلف پاسخ بده. این همون چیزیه که باعث شده ChatGPT یا Claude بتونن با زبان طبیعی باهات صحبت کنن.
۷. Distillation (تقطیر دانش)
Distillation یه تکنیکه برای اینکه یه مدل بزرگ و سنگین (Teacher) رو تبدیل کنیم به یه مدل کوچکتر و سریعتر (Student) بدون اینکه خیلی از دقتش کم بشه.
مثلاً GPT-4o ممکنه خیلی دقیق باشه ولی مدل گرونیه. با Distillation میتونیم یه نسخه سبکتر مثل GPT-4o mini تولید کنیم که روی موبایل یا مرورگر اجرا بشه.
به طور خلاصه این تکنیک اینطوری کار میکنه که مدل کوچکتر شروع میکنه به سوال پرسیدن از مدل اصلی و طی این فرآیند پاسخ هارو یاد میگیره.
۸. Fine-Tuning و LoRA
در Fine-Tuning سنتی، تمام پارامترهای مدل دوباره آموزش داده میشن، که منابع زیادی لازم داره.
اما LoRA یه روش سبکتره که فقط چند لایه کوچک به مدل اضافه میکنه و همونها آموزش میبینن. بهجای دستکاری کل مدل، فقط تنظیمات اضافه رو تغییر میدیم. این باعث میشه مدل سریعتر و با مصرف کمتر منابع برای کار خاصی بهینه بشه.
۹. Sampling, Top-k و Top-p (برای تولید متن)
وقتی مدل میخواد متن تولید کنه، از بین کلمههای ممکن، باید یه انتخاب انجام بده.
Greedy Sampling همیشه بهترین گزینه رو انتخاب میکنه ولی ممکنه جواب تکراری بشه.
Top-k فقط بین k تا از بهترین گزینهها انتخاب میکنه.
Top-p بین گزینههایی انتخاب میکنه که جمع احتمالشون به p درصد میرسه.
این تنظیمات روی سبک نوشتن مدل تأثیر زیادی دارن؛ مثلاً توی خلاقیت یا دقت متن.
#آموزشی
@aipulse24
Post #519
3.32K
AI Pulse ۱. پیشبینی (Inference) ‏Inference یعنی وقتی مدل آموزش دیده، ازش استفاده کنیم تا روی دادههای جدید پیشبینی انجام بده. این بخش همون استفاده عملی از مدله. مثلاً وقتی یه عکس جدید به یه مدل تشخیص چهره میدی، مدل از چیزهایی که یاد گرفته استفاده میکنه تا بگه…
- 👍 27
- ❤ 13
- 🙏 4
- 👏 2