TGViewer
Data Funk Data Funk @datafunk · 251 subscribers
Post #61 268
Наткнулся на 1.5Gb датасет русскоязычных текстов для задачи классификации детская/взрослая литература. Там же приложена статья авторов с архива, где они пишут - "We also found that some features used to determine text difficulty positively affect the quality of age-based classification". Часто оценка сложности чтения текста представляет собой линейную комбинацию различных статистик текста и их отношений (среднее число слогов в слове, среднее число слов в предложении и т.д.) Почему бы не сделать еще один индекс удобочитаемости просто как классификатор детской/взрослой литературы? Без эмбедингов и только линейная модель. Я использовал spaCy (c модулем русского языка ru_core_news_lg). Оказалось достаточно пометить какие из токенов в предложении являются стоп-словам (is_stop), пунктуацией (is_punct), словами с заглавной буквой (is_title), посчитать долю глухих согласных от длины слова (prop. of voiceless cons. in a word), количество и долю гласных в слове (count/prop. of vowels in a word), количество звонких согласных в слове (count of voiced cons. in a word).
More from @datafunk
  1. Sep 27, 2026Post #294
  2. Sep 14, 2026Post #293
  3. Sep 6, 2026Post #292
  4. Jul 10, 2026Команда из École Normale Supérieure (🇫🇷) собрала CalArena - один из самых больших бенчма…
  5. Jun 17, 2026Листаю статьи про A/B и ML, и это будто две разные вселенные. Только в Causal ML они хоть…
  6. Jun 7, 2026Что по плюсам: Скорость: Это в разы быстрее любых других методов. Строгость: На руках чест…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →