داشتم بلاگ کارپاتی رو میخوندم که چشمم خورد به microgpt. کلِ یه GPT رو ریخته توی ۲۰۰ خط پایتون خالص، بدون هیچ کتابخونهای... حتی بدون PyTorch. راستش رو بگم، خوندنش از صد تا مقاله عمیقتره. وقتی کل سیستم رو به اجزای سازندهش یعنی Dataset، Tokenizer، Autograd، Architecture و Optimizer تجزیه میکنی، تازه میفهمی چقدر همهچیز ریاضیاتِ ساده و ضرب و جمعه و هیچ جادویی در کار نیست.
بخش جالبش اینجاست که معماری دقیقاً شبیه GPT-2 هست: استفاده از RMSNorm، بلوکهای Attention برای ارتباط بین توکنها و MLP برای پردازشِ محلی... فقط مقیاسش کوچیکه. خروجیش هم تولید اسمهای الکی ولی با ساختارِ درست مثل "kamon" یا "vialan" هست. برای منی که هر روز دارم با پارامترهای بیلیونی و کلاسترهای GPU سر و کله میزنم، دیدنِ اینکه ۴۱۹۲ تا پارامتر هم میتونه "الگوهای آماری" رو اینقدر دقیق یاد بگیره، یه جورایی یادآوری میکنه که LLMها تهش فقط تکمیلکنندهی هوشمندِ متن هستن.
کاربردش؟ اگه میخوای بفهمی زیرِ کاپوتِ این مدلهای خفنِ دنیا واقعاً چی میگذره و از فضای "Prompt Engineering" بیای بیرون و وارد لایهی "Engine" بشی، این کد بهترین نقطه شروع هست... بدون هایپ، بدون پیچیدگی اضافه.
https://karpathy.github.io/2026/02/12/microgpt/
https://karpathy.ai/microgpt.html
🛠 Join @LLMEngineers Community
Post #381
1.36K
- 👍 16
- ❤ 7