TGViewer
Channel Public Channel
itbze | IT & язык

itbze | IT & язык

@itbze

👋🏻 Добро пожаловать!

Здесь мы публикуем интересные новости из мира IT, NLP, AI и делимся прогрессом в наших проектах.
Subscribers
1.29K
Photos
18
Videos
8
Links
20

Showing posts older than #35 · Back to latest

Older Posts 12 shown
Post #34 3.79K
🗡 Первый Лезгинский переводчик

Lezghian Community дообучили(fine-tune) нейросеть на корпусе из 13.8К параллельных предложений. В качестве базовой модели используется NLLB-200, о которой писал ранее.

По итогам тестирования метрика BLEU показывает отметку в 27 единиц точности перевода с двух сторон (Русский, Лезгинский), что является достойным результатом для столь малого количества данных.

Эти результаты указывают на то, что модель может производить точные переводы для обеих языковых пар. Однако есть планы по дальнейшему улучшению модели путем параллельного выравнивания корпусов для улучшения сопоставления пар предложений. Кроме того, будут предприняты усилия по сбору большего количества обучающих данных для повышения производительности модели, особенно при обработке более разнообразных и сложных лингвистических структур.

— пишут авторы.

☄️ Попробовать модель
huggingface.co Lezghian Nllb 200 Distilled 600M - a Hugging Face Space by leks-forever Discover amazing ML apps made by the community
  • ❤‍🔥 9
  • 🔥 8
  • ❤ 3
Post #29 3.36K
⚡️ Первые шаги по дообучению нейросети для генерации изображений.

Существующие модели не умеют генерировать национальные костюмы и атрибуты, они изображают костюмы дальневосточных и северных народов.

☄️ Обучение проводилось на базе модели FLUX, которая сейчас активно набирает популярность и показывает отличные результаты. Данные для обучения составлены из 110 выборочных изображений открытого датасета и дополнительных фотографий из интернета, изображающих национальные костюмы и атрибуты с текстовым описанием каждого из них.

☄️ Для обучения и использования моделей по генерации изображений требуется большое количество вычислительных ресурсов. Релиз модели в открытый доступ пока невозможен, так как необходимо установить цензуру и ограничения по содержанию запросов, которые исходят из этических норм народов Кавказа.

Вдохновление идеей канала @qunash_anzor

| itbze |
  • 🔥 18
  • ❤ 11
  • ❤‍🔥 7
Post #28 4.13K
⚜️ Представляю Вашему вниманию бота BzeGame для игры "Элиас (Крокодил)" на Кабардино-Черкесском языке!

Чтобы начать игру, добавьте бота в группу и предоставьте ему права администратора. Игрок, который запускает игру, становится ведущим и объясняет слова. В видеоролике подробно показано, как проходит игра.

Эта игра — отличный способ изучать новые слова и практиковать родной язык.

🏮 В будущих обновлениях планируется добавление новых языков!

Бот BzeGame для игры — https://t.me/BzeGameBot

| itbze |
  • 🔥 13
  • ❤ 10
  • ❤‍🔥 9
  • 👍 3
Post #27 2.68K
⚜️ Обучил модель Zehedz на архитектуре BERT для классификации текстов на три языка: русский, черкесский и карачаево-балкарский. Модель предсказывает язык с точностью 99,8% (от 4 слов в предложении), что является отличным результатом. Среднее время предсказания составляет 0,008 секунд.

Для обучения использовалась база данных, состоящая из 36К предложений, по 12 тысяч на каждый язык.

🏮 Модель будет полезна для определения исходного языка в переводчиках, что позволяет автоматически выбирать целевой язык. Также модель хорошо подходит для задач, связанных с классификацией большого объёма перемешанных данных. Её размер составляет 47 МБ, что позволяет запускать модель почти мгновенно и не занимать оперативную память.

Пример кода для работы с моделью через API платформы Hugging Face:

from gradio_client import Client

client = Client("alimboff/zehedz")

result = client.predict(
text="Добрый день!",
api_name="/predict")

print(result)


⚜️ Ссылки ⚜️

🏮 Попробовать модель
🏮 База данных
🏮 Исходный файл модели
  • 🔥 14
  • ❤‍🔥 7
  • ❤ 5
  • 👍 3
Post #26 2.63K
⚜️ Презентовали проект по включению кабардино-черкесского языка в Яндекс.Переводчик в Министерстве просвещения и науки КБР перед министром по делам национальностей и общественным проектам КБР Курашиновым Анзором Владимировичем, заместителем министра просвещения и науки КБР Мисостовой Екатериной Николаевной, сотрудниками Кабардино-Балкарского филиала Российской Академии Наук, сотрудниками кафедры кабардино-черкесского языка и литературы КБГУ, преподавателями родных языков с районов КБР.

🏮 Поделились предысторией проекта и исторической важностью ее реализации. В современных реалиях недостаточен тот объем контента и использования традиционных инструментов на родном языке для полноценного владения и общения молодежью.

🏮 Показали разработанную систему перевода и проверки предложений для составления параллельного корпуса данных из 100.000 строк для Яндекс.Переводчика. Система максимально упрощает работу специалистов и ускоряет процесс сбора и обработки необходимых данных.
  • 🔥 32
  • ❤ 14
  • ❤‍🔥 7
  • 👍 6
  • 🤩 2
Post #25 2.15K
Дообучаю нейросеть m2m100 для перевода на кабардино-черкесский язык. Эта модель, специализированная для перевода текстов с одного языка на другой, находится в открытом доступе и позволяет обучать ее новым языкам. В процессе дообучения я использую параллельный корпус кабардино-черкесского языка, который состоит из 60 тысяч пар предложений. Однако этого объема недостаточно для достижения высокого качества перевода.

Существующая «Адыгэ» версия m2m100 неплохо переводит с множества языков на кабардино-черкесский, но я сосредоточен на обучении модели для обратного перевода — с кабардино-черкесского на другие языки. Для создания действительно качественного переводчика нам потребуется значительно больше данных, собирать их мы будем в ходе реализации проекта.

После завершения сбора и создания качественного корпуса параллельных данных, можно будет дообучать новое поколение модели m2m100 — nllb-200. Я уже пробовал дообучать её на имеющемся корпусе, попробовать можно по ссылке — https://huggingface.co/spaces/alimboff/nllb-200-kbd
  • 🔥 16
  • ❤ 7
  • 👍 6
  • ❤‍🔥 2
Post #24 1.94K
⚜️ Новая модель от компании MetaAI* Признана экстремистской организацией и запрещена в РФ

Meta* выпустила самую большую языковую модель с открытым кодом Llama 3.1 с 405 миллиардами параметров.

Согласно текущим данным, Meta Llama 3.1 405B превзошла текущего лидера GPT-4o от OpenAI в нескольких ключевых тестах искусственного интеллекта.

Источник: https://habr.com/

Проверил модель на знание кабардино-черкесского, карачаево-балкарского, абхазского, осетинского и чеченского языков. Есть некоторые намеки на то, что модель что-то понимает.
Llama 3.1 в большинстве случаев определяет язык текста, но правильно перевести не может.
  • 🔥 13
  • ❤ 5
  • ❤‍🔥 4
Post #23 2.17K
✨ Новая модель от OpenAI

OpenAI выпустила новую версию своей языковой модели ChatGPT -- она получила название GPT-4o mini. По словам компании, это самая функциональная и экономически эффективная малая модель, доступная на сегодняшний день. Эта модель пришла на замену GPT-3.5, её уже можно попробовать на официальном сайте. (Не забудьте включить VPN.)

🏮Проверил модель на знание двух диалектов Черкесского и Карачаево-Балкарского языков. Результат нулевой, чего и стоило ожидать. Пока нейросетям от OpenAI ещё далеко по знанию языков по сравнению с моделями Google и Anthropic.
  • ❤ 15
  • 🔥 8
  • 👍 5
  • ❤‍🔥 3
Post #21 3.16K
⚜️ Объявляем о начале работы над добавлением Кабардино-Черкесского и Карачаево-Балкарского языков в Яндекс.Переводчик. ⚜️

При поддержке Министерства по делам национальностей КБР КБРОО "Черкесский Ренессанс" приступает к реализации проекта по добавлению титульных языков Кабардино-Балкарской Республики в Яндекс.Переводчик. Для достижения этой цели нам необходимо собрать большую базу данных — корпус параллельных предложений на этих языках.

Руководителем программной части проекта буду я — Алим Мамхегов. На канале буду выкладывать процесс работы над этим и другими проектами, актуальные новости в мире информационных технологий и нейронных сетей. В ходе реализации проекта мы будем работать над большим спектром разных задач, об этом всём буду писать здесь.

Есть ещё одна цель, которую мы должны достичь, о ней распишу позже. А пока предлагаю ознакомиться с моими проектами:

🏮 Zədzək | Черкесский переводчик

🏮
Sezluk | Карачаево-Балкарский переводчик
  • ❤ 43
  • 👏 16
  • 👍 10
  • ❤‍🔥 6
  • 🔥 4
  • 🤔 3
  • 👀 3
  • 😁 1
Post #17 1.97K
⚜️ Два диалекта черкесского языка присутствуют в Google Translate.

❗️Оказалось, что если ввести текст на кабардинском или адыгейском диалектах черкесского языка и выбрать один из нововведенных языков (абхазский, чеченский, осетинский, башкирский и т.д.), то текст будет переведен на выбранный язык. Переводчик справляется на "четверку", есть некоторые недоработки.

Вот что пишет Isaac R Caswell (инженер, курирующий проект по добавлению новых языков):

Я очень старался для Адыгейского и Кабардинского, но качество оказалось недостаточно высоким для запуска :( Я буду продолжать стараться!

Источник: https://x.com/iseeaswell/

На данный момент нет официальных переводчиков переводящих с Черкесского на другие языки (не наоборот), и это неплохой инструмент для перевода текстов, однако в конечном итоге их надо форматировать. Разработки Google по добавлению новых языков, включая языки народов России, — отличная новость. Будем следить за дальнейшими обновлениями.
  • ❤ 12
  • 👍 4
  • 🔥 3
Post #15 1.67K
27.06.2024 ⚜️ Большое обновление Google Translate: добавлено 110 новых языков!

Google Translate совершил своё крупнейшее обновление, добавив поддержку 110 новых языков.

🇷🇺 Добавленные языки народов России:

Abkhaz *, Avar, Bashkir, Buryat, Chechen, Chuvash, Crimean Tatar *, Komi, Meadow mari, Ossetian, Tuvan, Udmurt, Yakut

🧩 Как это работает?

Обновление стало возможным благодаря использованию модели PaLM 2, которая позволила более эффективно изучать родственные языки. Кроме того, Google активно сотрудничает с лингвистами и носителями языков, чтобы поддерживать разнообразие языковых вариантов и правописаний.

Это обновление является частью инициативы Google по поддержке 1000 наиболее распространённых языков в мире, и мы можем ожидать ещё больше обновлений в будущем.
  • ❤ 11
  • ❤‍🔥 4
  • 👍 3
  • 🔥 2
Post #1
Channel created
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →