TGViewer
Data Funk Data Funk @datafunk · 251 subscribers
Post #62 279
Дальше от этого берутся базовые статистики по каждому предложению, следом еще один слой статистик поверх предыдущих для каждого текста и из этого складывается линейная модель. Я ограничил формулу пятью слагаемыми, что бы она влезла в картинку и не выглядела слишком страшно. Даже с пятью слагаемыми линейка распознаёт взрослую и детскую литературу на тесте с точностью 0.76 (AUC = 0.83) и на картинке можно увидеть распределение этого кастомного индекса читабельности по каждому из типов литературы. Чем выше индекс, тем выше шанс, что текст детский и его легче читать.
Формулу сразу не просто интерпретировать, но кажется чем больше пунктуации, тем сложнее текст для чтения, а вот разнообразие стоп-слов и слов с заглавной буквой (имена и названия) наоборот упрощают чтение, как дисперсия слов с глухими согласными.

Датасет взят тут -> https://www.kaggle.com/oldaandozerskaya/fiction-corpus-for-agebased-text-classification
Kaggle RusAge: Corpus for Age-Based Text Classification Russian fiction books' previews with age rating labels.
More from @datafunk
  1. Sep 27, 2026Post #294
  2. Sep 14, 2026Post #293
  3. Sep 6, 2026Post #292
  4. Jul 10, 2026Команда из École Normale Supérieure (🇫🇷) собрала CalArena - один из самых больших бенчма…
  5. Jun 17, 2026Листаю статьи про A/B и ML, и это будто две разные вселенные. Только в Causal ML они хоть…
  6. Jun 7, 2026Что по плюсам: Скорость: Это в разы быстрее любых других методов. Строгость: На руках чест…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →