Build your first model postidan keyin AI/ML o’rganish bo’yicha savollar va maslahat so'rashlar yanada ko'paydi. Hozir trendda bo'lgani uchun bo'lsa kerak. Qisqacha tajribam haqida aytib beray.
2-yil oldin o’sha ilmiy ishni (research paper) o’qib hech narsa tushunmagandim. Bu ilmiy ish haqida Andrej Karpathy juda zo’r video darslik chiqargan. Yaqinda (o’tgan yili) amaliy tarzda, videolarga qaramasdan kichik progress qila oldim.
Generative Pre-trained Transformers (GPT) qurishni va transformer’lar hozirgi LLMlarni kengaya olishidagi o’rnini, attention mexanizmi haqida ko’plab o’rganasiz.
Bundan oldin Recurrent Neural Network (RNN) va LSTM degan modellardan foydalanishgan. Muammo, ular juda sekin, kengayishga qiyin va unutuvchan bo’lgan. Model promptni so’zma-so’z o'qiydigan bo'lgan, agar gap uzun bo’lsa gapni boshini unutib qo’yardi.
Transformer’lar esa bunga ajoyib yechim berishadi. Ular so’zma-so’z o’qish o’rniga butun gapni bittada o’qiydi. Va Self-Attention mexanizmi orqali gapdagi so’zlar bir-biriga qanday bog’liqligi borligini xisoblab ko’radi.
Misol uchun “I didn't eat the food on the table because it wasn’t delicious” gapidagi “it” nimani bildirayotganini bilishingiz kerak. Bu yerda u ovqatga "food"ga nisbatan kelayabdi, "table" so'ziga emas.
Xullas bu model tezroq LLMlarni train qilishga va kengaya olishiga sababchi bo’lgan. Xullas qisqasi transformer gapni “Attention” mexanizmi orqali outputga aylantirishini yaxshilab tushunib olasiz. Balkim keyingi eng zo'r GPT modellarni siz qurarsiz, who knows.
Attention is all you need
Post #577
10.7K