#startup
Dropbox'da ML team kichik model train qilishgandi. Biz uni olib Reinforcement Learning muhitga tashlab uni qilayotgan ishlarini kuzatgandik. Bu joyiga to'liq to'xtala olmayman, ammo qiziq bir narsani aytmoqchiman.
Agent muhitga tushganda turli xil yo'llarni sinab ko'radi. Agentga policy beriladi va u shundan chiqib ketmaslikga harakat qiladi. U har xil oldin ko'rmagan (pre-training jarayonida) ishlarni qilib ko'rishga va model mavjud parametrlarini yangilab, muhitda foydali bo‘lgan yangi xatti-harakat strategiyalarini o'rganishga harakat qiladi. Bu yerda odam emas, muhitni o'zi baho qo'yadi, reward (mukofot) yoki penalty (jazo).
Reward funksiyasi yozib chiqiladi (MDP - Markov Decision Process), u orqali agent harakatini baholash uchun formula yozasiz. Bu avtomatlashgan protsess. Qiziq tomoni unga berilgan topshiriq bo'yicha u xato qildi. Yomon baxo olib qayta urinib ko'rib yana xato qildi, umumiy 2ta xato. Yana urinish jarayonida endi bitta xatosini tuzatdi, ammo birinchi qilgan xatosi hali ham turibdi lekin yaxshi baho oldi. Eng qiziq tomoni u qilayotgan ishini unutib qo'ydi. Bu jarayonni qayta-qayta takrorlaganimizda u ba'zan bir nechta xato qilib ko'pini tuzatganda yaxshi baxo olishi bilan eski xatolarni tuzatmadi yoki eski xatosini borligini aytaveradi ammo hech tuzatmasdan boshqa ishlar qiladi.
Bu jarayonni AI agent'lar uchun tuzatish mumkin deb o'ylayman. Ba'zi qilib ko'rgan eksperimentlarim natijasi shuni aytayabdi. Ammo LLM modellar uchun bu jarayonga ko'proq RLHF (Reinforcement Learning from Human Feedback) kerak deb o'ylayman. Ammo u yerdagi odamlar ham professional bo'lishlari kerak. Bitta kamchilik bu jarayonda professional odamlarni rozi bo'lib o'tirishi qiyin, va bu ko'p vaqt oladi. Ammo shunday qilinsa hozirgi LLM (GPT) modellar ancha aqilliroq bo'lgan bo'larmidi deb o'ylaman.
Post #671
5.48K