TGViewer
Channel Public Channel
сегодня я нашла в НКРЯ

сегодня я нашла в НКРЯ

@ruscorpora_is_fun

Национальный корпус русского языка на каждый день:
- откуда в текстах девятнадцатого века Шрек
- когда в русском языке появилось слово «чипсы»
- как связаны ВИА Гра и Онегин
- что рифмуется с розой помимо морозов
и другие приключения, серьёзные и не очень
Subscribers
870
Photos
475
Videos
1
Links
201
Recent Posts 14 shown
Post #643 239
Двортерьер и интерьер

Хотела посмотреть на самых популярных терьеров в корпусе, не предвидела, что -терьером может быть не только собака.

Удивлена настолько огромной популярности фокстерьеров, побеждают с огромным отрывом.

Популярное обозначение дворняги, «двортерьер», до 2001 в корпус не попадается: мне, наоборот, казалось, что это что-то позднесоветское в первую очередь.

Ещё увидела в 1912 году «оредальтерьера из Германии», сначала подумала, что это эрдельтерьер, но это английская порода. Может, конечно, в Германии их тоже разводили, а может, просто какая-то иная разновидность. Загадка.
Управление Ю.-З. ж.д., как мы уже сообщали, решило выписать из Германии немецких овчарок и оредальтерьеров


#основной
  • ❤ 23
  • 😁 5
  • 👍 1
  • 🦄 1
Post #641 384
периодически попадаю в ситуации, когда говорю что-то вроде "надо бы в поезд еще анаком взять", вижу недоумение на лице мужа и уточняю "ну, в смысле, дошик"

судя по ГИКРЯ, и правда какая-то относительно южная история, вот такой нишевый регионализм

в примерах примерно такое же превращение в нарицательное обозначение, как и с дошираком, вот, например
Мы гуляли, как будто с уроков отпустили пораньше и можно есть сухой анаком на гаражах, придумывать игры на ходу, набивать болячки и потом бежать домой, чтобы успеть посмотреть' Шамана — кинга' .
  • ❤ 24
  • ❤‍🔥 3
  • 🔥 3
Post #640 454

Forwarded from Журнал | Смысловая 226

Тест: «Графоман» или право имеете?

Ко дню рождения Льва Николаевича Толстого мы вместе с лингвистом Марией Подрядчиковой собрали простой, но занимательный тест, который с достоверной точностью поможет определить, в чьей вы на самом деле команде: Толстого или Достоевского?🔥

Не верите? Давайте проверять!
  • ❤ 9
  • 🥰 5
Post #639 442
К дню рождения Толстого в Смысловой вышел вот такой полушуточный тест, основанный на частотностях из корпуса «Русская классика».

Очень боялась, что выйдет жуткий дисбаланс, но кажется, всё же распределяет на разные стороны — хоть и не всегда люди согласны ♠️ ♠️
  • ❤ 8
Post #637 481
Раз-глаз, градъ-братъ

Послезавтра иду слушать лекцию про древнерусский*, вдохновилась, решила посравнивать древнерусский корпус с основным и немножко залипла уже просто на топ-10 самых частотных существительных.

Нравится, как богъ сменился человеком — как говорится, многое говорит о нашем обществе. Случайные рифмы раз-глаз и градъ-братъ на 9-10 местах тоже повеселили (если это потянуло бы на рифму и в древнерусском, конечно).

День (дьнь) стабилен, лѣто сменилось годом (впрочем, все ещё оставаясь в настоящем в формах вроде 5 лет).

А ещё поменялась даже не сама лексика, а её разнообразие: если посмотреть на второй столбик, «употреблений на миллион слов», можно заметить, что в древнерусском самые частотные слова частотнее.

Впрочем, хотя бы в глаголах топ-1 совпадает — «быть» вне всякой конкуренции :)

*(Если вы в Москве, рекомендую! Это ещё и в Воронцовском парке, а он ранней осенью чудо как хорош)
  • ❤ 18
  • ⚡ 1
  • 😢 1
Post #636 591
🍁🍁🍁

#акцентологический
  • 😁 26
  • ❤ 16
  • 😭 3
Post #635 850
✍️✍️✍️ двухромокислая, свинячая утка
  • 😁 36
  • ❤ 7
  • ✍ 4
  • 👍 1
  • 🔥 1
  • 🥰 1
  • 👏 1
  • 🤔 1
  • 🤯 1
  • 😱 1
Post #631 933
раньше тоже была Спасская, а теперь — Ленина

Сегодня пишу из Тюмени, поэтому немного потыкала корпус русской детской литературы (https://detcorpus.ru/search/), чтобы подвердить очевидную гипотезу. Действительно, в детлите больше всего упоминаний Тюмени в книгах главного тюменского детского писателя Владислава Петровича Крапивина (как говорится, вот это новости, вилку нашли на кухне).

Корпус детской литературы классный! Очень давно не заходила, а когда искала там что-то раньше, это было крайне поверхностно, сегодня же потыкала внимательнее и порадовалась. ДетКорпус включает и художку, и поэзию, и нон-фикшен, и критику, есть отличный набор базовых инструментов — коллокации, частотность, ключевые слова.

В общем, все на месте, крайне рекомендую для исследовательских и ностальгических целей — вдруг вы хотели вспомнить, кто из ваших любимых детских авторов чаще всего упоминал мышат (судя по корпусу, Радий Погодин).

#некря
  • ❤ 21
  • ⚡ 3
  • 🥰 2
Post #630 686

Forwarded from Демонтаж красноречия

👍 Была вот такая нелепая новость:

Самое длинное слово в русском языке состоит из 55 букв, однако его можно еще увеличить, если «навешать радикалов». Об этом сообщает Telegram-канал «Подъем» со ссылкой на экспертов Института русистики.
Самое длинное слово в русском языке — это химический термин «тетрагидропиранилциклопентилтетрагидропиридопиридиновые», его обнаружили в названии патента на химическое соединение, которое применяют при производстве лекарств от аллергии и астмы.


«Институт русистики» звучит авторитетно, как будто это какой-то научно-исследовательский институт, возможно, в структуре Академии наук. Но нет, это что-то совершенно левое, да и не называют ничего у нас русистикой, это скорее названия для зарубежных специальностей и институций, занимающихся русским языком. Причем отдельные специалисты могут называться русистами и у нас (как противопоставление германистам, иранистам, китаистам и т. д.).

Совсем бессмысленно считать слова в буквах (на секунду забудем, что бессмысленно считать длину слов вообще). Например, я могу сделать слово какой угодно длины по такой модели: а-а-а-а (и дальше произвольное число букв), и это будет слово русского языка.

Считать длину слова (если уж так хочется) нужно в слогах. И, само собой, химические термины, то есть единицы особой подсистемы языка, вряд ли нас удивят, хочется чего-то такого, что прозвучит в естественном контексте.

Свехдлинных слов в естественных контекстах, конечно, не бывает, но это должен быть хотя бы не специализированный контекст научной лаборатории, куда большинство из нас никогда не попадет.

И я нашел такое слово не из научного подъязыка, которое находится в коллекции НКРЯ, и даже по буквам длиннее химического термина (у того 55, у нашего 80). Это — четырехмиллионнопятьсотсорокасемитысячвосемьсотдвацатитрехквадратнокилометрового. Слово совершенно реальное из книги И. Н. Вирабова «Андрей Вознесенский» (2015), так что это его не лингвисты для НКРЯ придумали.

Есть и менее претенциозное слово покороче, которое даже можно при желании запомнить: недоиндивидуализированные (клик), всего 25 букв, но зато можно ввернуть в застольной беседе.
  • ❤ 22
  • 🦄 3
  • 💊 1
Post #629 509
четырехмиллионнопятьсотсорокасемитысячвосемьсотдвадцатитрехквадратнокилометрового

Сегодня в НКРЯ нашла не я, а филолог Борис Орехов, и нашёл нечто немножко монструозное из заголовка этого поста.
Попробуем посмотреть, как можно это быстро проверить по корпусу (можно, конечно, и просто спросить Бориса Валерьевича, но так было бы неинтересно :):
1. Для технических задачек такого рода удобнее работать с регулярными выражениями: добавляем в поиск опцию "словоформа с регулярными выражениями"
2. Для русских слов используем только буквы кириллицы — они обозначаются как [а-я]
3. Добавляем указатель на число букв (от 80, раз уж мы точно знаем, что 80 можно) — получаем [а-я]{80,}
Если бы нужно было от 50, вышло бы [а-я]{50,}, если от 30 до 100 — [а-я]{30,100} и тому подобное.
Подробнее про поиск через регулярки можно почитать здесь: https://ruscorpora.ru/page/tool-regexp/

Любуемся на выдачу: да, действительно, слово из заголовка — самое длинное из "естественных" слов, аааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааа (количество а именно такое) и Центральвиссеншафтлихгелээртермэншэнлебэнсбедингунгенфербессэрунгсауссшусстрэффпунктклассэ вряд ли на звание самого длинного слова русского языка в основном корпусе НКРЯ могут претендовать :)

Ссылка: https://ruscorpora.ru/s/0gjpN
  • 🔥 15
  • ❤ 8
  • 👀 2
Post #628 546
Возможно, вы ещё не видели рифму "с Днем Варенья — День Рожденье", а она в акцентологическом корпусе есть (там чего только нет)
  • ❤ 22
  • 🔥 10
  • 😭 8
  • 🏆 5
Post #626 787
В отпуске на Байкале очень уж было красиво, вот и не писала толком ничего;

Вот кусочек про бобра и бабра (тоже немножко иркутского в некотором роде) от Хлебникова — так сказать, весьма вольная, поэтическая этимология
  • ❤ 31
  • 🥰 14
Post #625 952
Сегодня очень простая загадка про сравнение похожих слов для разных периодов :) Угадаете, какое существительное закрыли?
Конец XIX века и середина XX-го — прямо-таки хрестоматийный пример для тестирования инструмента "Портрета слова" :)
  • 🔥 21
  • 😁 8
  • 🥰 1
Post #624 1.05K

Forwarded from Системный Блокъ

Язык через призму данных — новый проект «Системного Блока»

Как проследить, менялось ли значение слова со временем? Как сравнить между собой тексты разных авторов? И зачем лингвисты считают миллионы слов вместо того, чтобы читать книги?

Мы запускаем новый проект о корпусной лингвистике — направлении, которое изучает язык с помощью больших коллекций текстов. На одной странице мы собрали материалы, которые помогут разобраться, как устроены языковые корпусы, что можно узнать с их помощью и как самостоятельно анализировать тексты — даже без опыта в программировании.

Вы узнаете, что такое Национальный корпус русского языка и почему им пользуются не только лингвисты, но и журналисты, учителя и литературоведы. Мы рассказали, как корпус создается, как нейросети помогают размечать слова, зачем нужны поэтические и драматургические корпусы и почему одного НКРЯ недостаточно для всех исследовательских задач.

Мы собрали реальные примеры исследований: как алгоритмы определяют сюжеты в песнях — от рок-баллад до Тейлор Свифт, как на текстах корпуса stihi.ru изучать наивную поэзию, как анализ текстов помогает исследовать орфографию и даже искать животных в детской литературе.

Для тех, кто хочет попробовать корпусный анализ самостоятельно, есть практические руководства. А еще — тесты, с помощью которых можно узнать что-то неожиданное о русском языке. Например, какие ругательства встречаются в НКРЯ или что значат редкие слова в произведениях Льва Толстого.

Изучить проект — по ссылке.

🤖 «Системный Блокъ» @sysblok
  • ❤ 8
  • 🔥 4
  • 👍 1
Older posts →

About this channel

How can I read @ruscorpora_is_fun without a Telegram account?
TGViewer shows the public web preview Telegram publishes for сегодня я нашла в НКРЯ: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does сегодня я нашла в НКРЯ have?
сегодня я нашла в НКРЯ (@ruscorpora_is_fun) has 870 subscribers on Telegram, refreshed roughly every 30 minutes.
Does сегодня я нашла в НКРЯ know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →