Смех и слезы в интернете
1 апреля вспоминаем наш материал про 😄, 🤣 и 🤡. Рассказываем, как люди начали пользоваться эмотиконами — и как теперь их семантику изучают компьютерными методами. Посвящается тем, кто хотя бы раз не мог понять, ироничен 👍 или нет.
Кратко: о чём статья?
Во второй половине XX века с развитием технологий, позволяющих расширить границы письменного общения, люди стали писать чаще, больше и короче. В 1969 году Владимир Набоков хотел «придумать какой-нибудь типографический знак, обозначающий улыбку», а уже в 2000-х эмодзи захватили мессенджеры и Интернет.
Сегодня эмодзи и их значения активно изучаются специалистами в области NLP (Natural Language Processing), которые создали целую Emoji-арифметику. Для векторных представлений смайликов было разработано «правило суммы значений». Для обычной модели word2vec (подробнее о ней — в этом материале) его часто описывают так: король-мужчина + женщина = королева. А ещё с 2017 года Яндекс.Переводчик умеет переводить тексты в эмодзи, используя «словарный» алгоритм: переводчик выбирает изображение, в описании которого используется введенное слово. Вот так, например, он представляет «Системный Блокъ» сегодня: ⚙️ ⚒.
Сравнить этот перевод с предложенным в 2020, узнать, как модели обучали на постах из социальных сетей и по каким критериям оценивалась близость разных эмодзи можно из полного текста статьи.
Время чтения: 8 минут.
Post #601
2.39K