Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space
[Статья] [Кода нет]
Введение
Моделирование естественного языка через фиксированные токены, полученные через BPE или иной процедурой, не ругал только ленивый.
Инференс предсказания одного токены требует фиксированного количества вычислений, при том что сами токены обладают очень разной смысловой нагрузкой и предсказуемостью.
Ранее уже были сделаны попытки отойти от привычной парадигмы - Byte Latent Transformer , COCONUT и Large Concept Model (LCM). Однако и у этих подходов есть ограничения. COCONUT, использующий непрерывные эмбеды, не транслируется естественным образом в естественный язык, а SONAR эмбеддинги полагаются на предопределенный человек метод разбиения на предложения.
В этой же статье предлагают динамическое разбиение с автоматическим слиянием токенов.
Post #613
1.63K

- 🔥 6