یه پروژه خیلی جالب برای کسایی که میخوان بفهمن پشت صحنهی LLMها چی میگذره ساخته شده. این ریپو قدمبهقدم نشون میده چطور یه مدل زبانی رو از صفر بسازید؛ از جمعآوری و آمادهسازی دادهها گرفته تا ساخت کامل معماری Transformer با PyTorch و در نهایت اینکه مدل چطور شروع به تولید متن میکنه. حتی بخشهایی مثل Attention، Multi-Head Attention، بلاکهای Transformer و کل ساختار مدل هم خودشون از صفر پیادهسازی شدن و با توضیحات و نمودارهای ساده توضیح داده شدن.
github.com/FareedKhan-dev/train-llm-from-scratch
@Linuxor
Post #4518
9.82K
