یکی از مراحل پیشپردازش متن Subword Tokenization است که مشکل پردازش و امبدینگ کلمات ناآشنا (که در پیکره نبودند) را که در Tokenization وجود دارد حل میکند.
یکی از بهترین الگوریتمها برای این کار BPE(Byte Pair Encoding) است که در بهترین مدلهای زبانی امروزی مثل GPT2 و LASER هم استفاده شده.
لینک پایین این الگوریتم را به خوبی توضیح داده و کد هم براش آورده:
https://towardsdatascience.com/byte-pair-encoding-the-dark-horse-of-modern-nlp-eb36c7df4f10
#read
#blog
@nlp_stuff
Post #6
831