🎯Математика для Data Scientist’а, часть 2: Закон Ципфа
Эта эмпирическая закономерность распределения частоты слов естественного языка часто используется в количественной лингвистике и NLP-задачах. Закон Ципфа гласит: если все слова в большом тексте упорядочить по убыванию частоты их использования, то частота n-го слова в этом списке будет обратно пропорциональна его порядковому номеру n (рангу). Например, второе по используемости слово встречается примерно в два раза реже, чем первое, третье — в три раза реже, чем первое, и т.д.
Впервые закономерность была открыта французским стенографистом Жан-Батистом Эсту в 1908 году. На практике закон был применён для описания распределения размеров городов немецким физиком Феликсом Ауэрбахом в 1913 году. А американский лингвист Джордж Ципф в 1949 году активно популяризировал эту закономерность, предложив использовать её для описания распределения экономических сил и социального статуса: самый богатый человек имеет вдвое больше денег, чем следующий богач, и т.д. Объяснение закона Ципфа на основе корреляционных свойств аддитивных марковских цепей (со ступенчатой функцией памяти) дано в 2005 году. Математически закон Ципфа описывается распределением Парето (всем известный принцип 80 на 20).
Разные области применения закона (не только лингвистика) объяснены американским специалистом по биоинформатике Вэньтянь Ли, который доказал, что случайная последовательность символов также подчиняется этому закону Ципфа. Ли утверждает, что закон Ципфа - статистический феномен, который не имеет отношения к семантике текста, а вероятность случайного появления какого-либо слова длиной n в цепочке случайных символов уменьшается с ростом n в той же пропорции, в какой растёт ранг этого слова в частотном списке (порядковой шкале). Потому произведение ранга слова на его частоту есть константа.
Post #48
172