Интересный факт о том, почему нейросетевые модели, такие как ChatGPT, не могут точно сказать, сколько букв "R" в слове strawberry 🍓
Токенизация определяет, как модель "видит" и разделяет слова на части. Например, модель может увидеть число 380 целиком как "380", а число 381 как два отдельных токена: "38" и "1". Это показывает, что токены ≠ слова и токены ≠ слоги. Это как раз и объясняет, почему модели часто путаются в таких, казалось бы, простых задачах, как подсчет букв.
Например, в слове strawberry модель видит слово как совокупность токенов, и не все они совпадают с буквами. Пробелы также могут быть токенами, а регистр влияет на восприятие. Это создает барьеры в решении фонетических и простых математических задач, таких как подсчет букв "R".
Post #150
76

- 👾 4