TGViewer
Otabek’s I/O Otabek’s I/O @otabekswe · 2.84K subscribers
Post #671 5.48K
#startup

Dropbox'da ML team kichik model train qilishgandi. Biz uni olib Reinforcement Learning muhitga tashlab uni qilayotgan ishlarini kuzatgandik. Bu joyiga to'liq to'xtala olmayman, ammo qiziq bir narsani aytmoqchiman.

Agent muhitga tushganda turli xil yo'llarni sinab ko'radi. Agentga policy beriladi va u shundan chiqib ketmaslikga harakat qiladi. U har xil oldin ko'rmagan (pre-training jarayonida) ishlarni qilib ko'rishga va model mavjud parametrlarini yangilab, muhitda foydali bo‘lgan yangi xatti-harakat strategiyalarini o'rganishga harakat qiladi. Bu yerda odam emas, muhitni o'zi baho qo'yadi, reward (mukofot) yoki penalty (jazo).

Reward funksiyasi yozib chiqiladi (MDP - Markov Decision Process), u orqali agent harakatini baholash uchun formula yozasiz. Bu avtomatlashgan protsess. Qiziq tomoni unga berilgan topshiriq bo'yicha u xato qildi. Yomon baxo olib qayta urinib ko'rib yana xato qildi, umumiy 2ta xato. Yana urinish jarayonida endi bitta xatosini tuzatdi, ammo birinchi qilgan xatosi hali ham turibdi lekin yaxshi baho oldi. Eng qiziq tomoni u qilayotgan ishini unutib qo'ydi. Bu jarayonni qayta-qayta takrorlaganimizda u ba'zan bir nechta xato qilib ko'pini tuzatganda yaxshi baxo olishi bilan eski xatolarni tuzatmadi yoki eski xatosini borligini aytaveradi ammo hech tuzatmasdan boshqa ishlar qiladi.

Bu jarayonni AI agent'lar uchun tuzatish mumkin deb o'ylayman. Ba'zi qilib ko'rgan eksperimentlarim natijasi shuni aytayabdi. Ammo LLM modellar uchun bu jarayonga ko'proq RLHF (Reinforcement Learning from Human Feedback) kerak deb o'ylayman. Ammo u yerdagi odamlar ham professional bo'lishlari kerak. Bitta kamchilik bu jarayonda professional odamlarni rozi bo'lib o'tirishi qiyin, va bu ko'p vaqt oladi. Ammo shunday qilinsa hozirgi LLM (GPT) modellar ancha aqilliroq bo'lgan bo'larmidi deb o'ylaman.
More from @otabekswe
  1. Sep 28, 2026Voicelab da bizga eng qiziq bo'lgan mavzu bu Small Language Models (Large Language Models…
  2. Sep 10, 2026Barchamiz miriqib kuzatgan O'rgimchak Odam, Chaqmoq Makvin, Aka-uka Kreshlar (Muzlik davri…
  3. Sep 7, 2026Biz yangilik qilishdan to'xtamayabmiz. • Aisha Comet LLM modelimizni chiqardik. Platformag…
  4. Sep 4, 2026#experience Deyarli bir yarim yildan buyon intervyular jarayonida bitta savol doim so'raym…
  5. Aug 28, 2026#experience Ko'pchilik bir xil savol beradi: "Model o'zilarnikimi yoki open-source modelmi…
  6. Aug 25, 2026Voicelab Desktop V1 chiqdi (katta yangilanish va yaxshilanish qildik), har kunlik bepul kr…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →