TGViewer
Channel Public Channel
Big Data Science [RU]

Big Data Science [RU]

@bdscience_ru

Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Subscribers
1.62K
Photos
80
Videos
9
Links
545

Showing posts older than #465 · Back to latest

Older Posts 20 shown
Post #464 830
🌎ТОП сентябрьских ивентов в Data Science
2 сентября
- Yandex Go Infra Meetup #2 – Москва, Россия - https://events.yandex.ru/events/go/infra-2/
4-5 сентября – Flow 2023 – Онлайн - https://flowconf.ru/
6-7 сентября – SmartData – Онлайн - https://smartdataconf.ru/
12 сентября - Yandex DataSphere для образования – Онлайн - https://cloud.yandex.ru/events/817
14 сентября – конференция «Большие данные и бизнес-аналитика 2023» - https://events.cnews.ru/events/bolshie_dannye_i_biznes_analitika__chto_jdet_rynok_k_koncu_2024_goda.shtml
15 сентября - CrossConf 2023 – Москва, Россия - https://crossconf.com/
21 сентября - Управление данными 2023 – Москва, Россия - https://www.osp.ru/lp/dm2023
Post #463 917
📚⚡️Вертикальное масштабирование: преимущества и недостатки
Вертикальное масштабирование данных
- это подход к масштабированию баз данных, при котором увеличение производительности достигается путем добавления ресурсов (например, процессоров, памяти) к существующим узлам системы. Этот подход ориентирован на улучшение производительности системы путем увеличения ее ресурсов внутри каждого узла, а не добавления новых узлов.
Преимущества вертикального масштабирования данных:
1. Улучшенная производительность:
Добавление ресурсов к существующим узлам позволяет обрабатывать больше данных и запросов на одном сервере. Это может привести к улучшению отклика и общей производительности системы.
2. Простота управления: По сравнению с горизонтальным масштабированием (добавление новых серверов), вертикальное масштабирование менее сложно в управлении, так как оно не требует такой же степени настройки и синхронизации между разными узлами.
3. Экономия на затратах на инфраструктуру: Добавление ресурсов к существующим серверам может быть экономически более выгодным, чем покупка и поддержка дополнительных серверов.

Недостатки вертикального масштабирования данных:
1. Ограничение по ресурсам:
Вертикальное масштабирование имеет пределы, определяемые максимальной производительностью и ресурсами отдельного узла. Рано или поздно можно достичь точки, когда дальнейшее увеличение ресурсов не приведет к значительному улучшению производительности.
2. Сингл-пойнт-оф-фейлур: Если узел, к которому добавляются ресурсы, выходит из строя, это может повлечь за собой серьезные проблемы с доступностью всей системы. В горизонтальном масштабировании потеря одного узла не оказывает столь существенного влияния.
3. Ограниченная масштабируемость: По мере роста нагрузки может потребоваться добавление все большего количества ресурсов, что в конечном итоге может стать неэффективным или дорогостоящим.
4. Предел ресурсов: При вертикальном масштабировании ресурс, который оказывается наиболее узким местом, может быть увеличен только до определенного предела. Если это именно тот ресурс, который ограничивает производительность, то дополнительные ресурсы могут быть затрачены неэффективно.
  • ❤ 1
  • 👍 1
Post #462 1.08K
💥😎Недавно в сети появился датасет для сегментации видео с помощью выражений движения
MeViS — это крупномасштабный набор данных для сегментации видео, управляемой выражениями движения, который фокусируется на сегментации объектов в видеоконтенте на основе предложения, описывающего движение объектов. Набор данных содержит множество выражений движения для обозначения целевых объектов в сложных средах.
GitHub GitHub - henghuiding/MeViS: [ICCV 2023] MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions [ICCV 2023] MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions - henghuiding/MeViS
  • 👍 1
Post #461 1.07K
🔎📝Фреймворк DBT: преимущества и недостатки
DBT (Data Build Tool) - это открытый фреймворк для анализа данных, который облегчает процесс подготовки и обработки данных перед аналитическими запросами. DBT был разработан с учетом особенностей современных аналитических практик и ориентирован на работу с данными в среде хранилищ данных и аналитических баз данных. Основной целью DBT является обеспечение практичных инструментов для управления и преобразования данными в процессе подготовки аналитической среды.
Преимущества DBT:
1. Модульность и управляемость:
DBT позволяет создавать модули данных, которые могут быть легко переиспользованы и расширены. Это облегчает управление и обслуживание аналитической инфраструктуры.
2. Версионирование и управление изменениями: DBT поддерживает версионирование кода и документации, что делает управление изменениями и совместной работой более эффективными.
3. Автоматизация процесса ETL: DBT предоставляет инструменты для автоматизации процесса извлечения, преобразования и загрузки данных (ETL). Это позволяет сократить затраты времени и усилий на рутинные задачи.
4. Отслеживание зависимостей: DBT автоматически управляет зависимостями между различными частями данных, что облегчает обновления и поддержание консистентности аналитической среды.
5. Использование SQL: DBT использует SQL для описания преобразований данных, что делает его доступным для аналитиков и разработчиков.

Недостатки DBT:
1. Ограничения сложных вычислений:
DBT больше подходит для трансформации и подготовки данных, чем для сложных вычислений или машинного обучения.
2. Усложнение для крупных проектов: Для крупных проектов с большим количеством данных и сложными зависимостями между таблицами может потребоваться дополнительная настройка и управление.
3. Сложность внедрения: Внедрение DBT может потребовать времени и ресурсов для настройки и обучения сотрудников.

Общий вывод: DBT - это мощный инструмент для управления и подготовки данных в аналитической среде. Он предоставляет множество преимуществ, но может быть менее подходящим для сложных вычислений и больших проектов. Перед использованием DBT рекомендуется тщательно изучить его функциональные возможности и адаптировать под конкретные потребности организации.
Getdbt About dbt Core installation | dbt Developer Hub Install dbt Core locally to begin transforming your data.
  • 👍 2
  • 😁 1
Post #460 1.55K
🔉💥Открыли доступ к более 1,5 ТБ размеченных наборов аудиоданных
В Wonder Technologies было затрачено значительное количество времени разработчиками на формирование систем глубокого обучения, способных воспринимать мир через звуковые сигналы. От применения глубокого обучения, основанного на анализе звуковых данных, до обучения компьютеров распознаванию эмоций в звуке, компания использовала широкий набор данных для создания API, способных эффективно функционировать даже в экстремальных звуковых условиях. Как отмечают разработчики, на сайте приведен перечень наборов данных, которые оказались весьма полезными в ходе исследований и которые использовались для улучшения производительности звуковых моделей в реальных сценариях.
machinelearningmastery.ru Более 1,5 ТБ меченых наборов аудиоданных
  • 👍 3
  • ❤ 1
Post #459 1.1K
⚔️⚡️Сравнение Spark Dataframe и Pandas Dataframe: преимущества и недостатки
Датафреймы - это структурированные объекты данных, которые позволяют анализировать и манипулировать большими объемами информации. Два наиболее популярных инструмента для работы с датафреймами - это Spark Dataframe и Pandas Dataframe.
Pandas - это библиотека для анализа данных на языке программирования Python. Pandas Dataframe предоставляет простой и интуитивно понятный способ для анализа и манипулирования табличными данными.
Преимущества Pandas Dataframe:
1. Простота использования:
Pandas предлагает интуитивный и легкий в использовании интерфейс для анализа данных. Он позволяет быстро загружать, фильтровать, преобразовывать и агрегировать данные.
2. Богатая интеграция с экосистемой Python: Pandas интегрируется хорошо с другими библиотеками Python, такими как NumPy, Matplotlib и Scikit-Learn, что делает его удобным инструментом для анализа данных и построения моделей.
3. Поддержка временных рядов: Pandas предоставляет отличные средства для работы с временными рядами, включая функции для ресемплинга, временных окон, выравнивания и агрегирования данных.
Недостатки Pandas Dataframe:
1. Ограниченная масштабируемость:
Pandas работает в одном потоке и может столкнуться с ограничениями по производительности при работе с большими объемами данных.
2. Память: Pandas требует загрузки всего набора данных в память, что может стать проблемой при работе с очень большими таблицами.
3. Не подходит для распределенных вычислений: Pandas не предназначен для распределенных вычислений на кластерах серверов и не обеспечивает автоматического масштабирования.

Apache Spark - это распределенная вычислительная платформа, предназначенная для эффективной обработки больших объемов данных. Spark Dataframe - это абстракция данных, которая предоставляет интерфейс, аналогичный Pandas Dataframe, но с некоторыми критичными отличиями.
Преимущества Spark Dataframe:
1. Масштабируемость:
Spark Dataframe обеспечивает распределенные вычисления, что позволяет эффективно обрабатывать большие объемы данных на кластерах серверов.
2. Ин-моментные вычисления: Spark Dataframe поддерживает операции "в памяти", что позволяет значительно ускорить выполнение запросов и манипуляций с данными.
3. Языковая поддержка: Spark Dataframe поддерживает несколько языков программирования, включая Scala, Java, Python и R.
Недостатки Spark Dataframe:
1. Немного более низкая производительность для небольших объемов данных:
Из-за накладных расходов на распределенные вычисления Spark Dataframe может показывать немного более низкую производительность при обработке небольших объемов данных по сравнению с Pandas.
2. Издержки памяти: В силу своей распределенности, Spark Dataframe требует больше оперативной памяти по сравнению с Pandas Dataframe, что может потребовать более мощных серверов для обработки данных.
  • 👍 5
  • ❤ 2
  • 🔥 1
Post #458 836
📝🔎Data Observability: преимущества и недостатки
Data Observability (наблюдаемость данных)
- это концепция и практика обеспечения прозрачности, контроля и понимания данных в информационных системах и аналитических процессах. Она направлена на обеспечение того, чтобы данные были доступны, точны, актуальны и понятны для всех, кто взаимодействует с ними: от аналитиков и инженеров до бизнес-пользователей.
Преимущества Data Observability:
1. Быстрое выявление и устранение проблем:
Data Observability помогает быстро обнаруживать и устранять ошибки и неполадки в данных. Это особенно важно в случаях, когда даже небольшие неполадки могут привести к серьезным ошибкам в аналитических выводах.
2. Улучшение качества аналитики: Благодаря контролю за данными, аналитики могут быть уверены в точности и надежности результатов своей работы. Это способствует принятию более обоснованных решений.
3. Улучшение сотрудничества: Data Observability создает общий язык и понимание данных между разными командами - от инженеров до бизнес-пользователей. Это способствует лучшему сотрудничеству и более эффективному обмену информацией.
4. Снижение рисков: Путем обеспечения надежности данных Data Observability помогает снизить риски, связанные с неправильными решениями, основанными на неточных или некорректных данных.
Недостатки Data Observability:
1. Сложность внедрения:
Реализация системы Data Observability может быть сложной и требовать времени и усилий. Это может потребовать изменений в архитектуре данных и добавления дополнительных инструментов.
2. Затраты: Внедрение и поддержание системы наблюдаемости данных может быть затратным процессом. Это включает в себя как финансовые затраты на инструменты, так и затраты на обучение и обслуживание персонала.
3. Сложность масштабирования: При росте объема данных и сложности системы могут возникнуть трудности с масштабированием системы наблюдаемости данных.
4. Сложность обучения персонала: Персоналу придется освоить новые инструменты и практики, что может потребовать времени и обучения.

В целом, Data Observability играет важную роль в обеспечении надежности и качества данных, но ее внедрение требует внимательного планирования и балансировки между преимуществами и затратами.
Post #457 827
⚡️💥ConvertCSV — универсальный инструмент для работы с CSV
ConvertCSV является отличным решением для обработки и преобразования CSV и TSV-файлов в различные форматы, среди которых: JSON, PDF, SQL, XML, HTML и т.д.
Важно отметить, что вся обработка данных происходит локально на вашем компьютере, что гарантирует безопасность пользовательских данных. Этот сервис также обеспечивает поддержку Excel, а также предлагает инструменты для работы через командную строку и настольные приложения.
Convertcsv ConvertCSV.com - Convert CSV To JSON, XML, SQL, ... ConvertCSV.com contains online tools for converting CSV and Excel data.
  • 👍 3
Post #456 850
Хотелось бы рассказать о виртуальном дата-центре, предоставляемом облачным провайдером Русоникс.
Данный продукт относится к категории "Инфраструктура как услуга" (IaaS) и может быть весьма полезен для решения задач в области Data Science.

Как и у прочих облачных провайдеров, стоимость использования VPS-сервера зависит от потребляемых ресурсов и первичных настроек, стартуя от 1000 рублей в месяц на самой простой конфигурации (ОС Rocky Linux 8 Plesk на 2 виртуальный ЦП с 2ГБ памяти, 20 ГБ SSD и 1-м IPv4-адресом). Максимальная стоимость около 18 тысяч в месяц для ОС Rocky Linux 8 Plesk, 8 виртуальных ЦП, 28 ГБ ОЗУ, хранилище почти 2 терабайта SSD и 20 IPv4-адресов.
Также хотелось бы отметить, что существует заказ дополнительных услуг таких, как CDN, и облачный бекап, а такие услуги как "AntiDDoS" и "Защита данных владельца домена", дают возможность максимально обезопасить свои данные.
По сравнению с Яндекс.Cloud, облако Русоникс работает быстрее во многих задачах. Особенно это касается Data Science, где следует отметить превосходство Русоникс в тестах по детекции лиц и машинному обучению. Например, в многоядерном режиме Русоникс обнаруживает лица на 5.26 изображений в секунду, тогда как Яндекс.Cloud обрабатывает только 4.97 изображения в секунду. Но в ML-тестах Русоникс немного уступает, обрабатывая 18.5 изображений в секунду против 21.4 в Яндекс.Cloud.
Однако в многоядерном режиме Русоникс значительно превосходит конкурента, обрабатывая 9.27 изображений в секунду против 5.53. В ML-кейсах Русоникс также лидирует, обрабатывая 33.8 изображений в секунду, тогда как Яндекс.Cloud справляется только с 23.5.
Использование облака Русоникс сопоставимо с ценами других провайдеров, таких как Google Cloud, Amazon Web Services, Microsoft Azure. Но, в отличие от них, Русоникс является отечественной компанией, независящей от санкций и прочих ограничений, что делает ее еще более надежной. Также стоит отметить, что решения Русоникс созданы на базе открытого софта, доработанного опытными специалистами.
Что делает облако Русоникс особенно привлекательным - это доступная цена, которая бьет конкурентов, таких как Яша и Селектелл.
Однако, если если вы не готовы сейчас делать миграцию, не беспокойтесь! Коллеги из Русоникс понимают важность минимизации рисков. И если платформы, такие как VMWare, могут быть отключены хостерам, включая российские компании, то с Русоникс у вас всегда будет запасной вариант - резервная площадка, которая позволит вам моментально переключиться и продолжить работу без перебоев.

На данный момент компания провела полное обновление программно-аппаратной платформы и создала новый, улучшенный Личный Кабинет, который значительно удобнее и легче в восприятии, чем, например, у Amazon WS или у Microsoft Azure.
Следует также подчеркнуть, данный веб-интерфейс позволяет легко создавать виртуальные VPS-серверы всего в 2 шага: выбрать необходимый тариф и настроить параметры (Дисковое пространство, Оперативная память, Количество процессоров, Публичные IPv4-адреса, Лицензия Plesk, Операционная Система, CMS и Доменное имя)
С точки зрения пользователя, также хотелось бы отметить, что существуют ограничения на виды операционных систем при создании собственного сервера через публичное облако: возможен выбор из существующих вариантов. Однако существует возможность загружать собственные образы операционных систем.
Еще одной важной особенностью Русоникс является достаточно легкий расчет без скрытых платежей и использования OpenStack ПО, лежащего в основе движка.

Не упустите случай оценить возможности данного решения: https://www.rusonyx.ru/services/iaas/
  • 👍 3
Post #455 686
📝🔎Проблемы и решения разметки текстовых данных
Разметка текстовых данных является важной задачей в области машинного обучения и обработки естественного языка. Однако, она может столкнуться с различными проблемами, которые могут затруднить и усложнить процесс. Ниже перечислены некоторые из этих проблем и возможные пути их решения:
1. Субъективность и неоднозначность: Разметка текста может быть субъективной и неоднозначной, так как разные люди могут интерпретировать содержание по-разному. Это может привести к несогласованности между разметчиками.
Решение: Для уменьшения субъективности, необходимо предоставить разметчикам четкие инструкции и правила разметки. Обсуждение и ревизия результатов между разметчиками также могут помочь выявить и устранить неоднозначности.
2. Высокая стоимость и времязатратность: Разметка текстовых данных может быть дорогостоящей и требовать большого объема времени, особенно когда работают с большими наборами данных.
Решение: Использование методов автоматической разметки и машинного обучения для начального этапа может значительно сократить объем работы человека. Также стоит обратить внимание на возможность использования краудсорсинговых платформ, чтобы привлечь больше разметчиков и ускорить процесс.
3. Отсутствие стандартов и форматов: Нет единого стандарта для разметки текстовых данных, и разные проекты могут использовать различные форматы разметки.
Решение: Определите стандарты и форматы для разметки данных в вашем проекте. Следуйте общепринятым стандартам, таким как XML, JSON или IOB (Inside-Outside-Beginning), чтобы обеспечить совместимость и удобство взаимодействия с другими инструментами и библиотеками.
4. Малообученность разметчиков: Разметка текстовых данных может требовать экспертного знания или опыта в определенной предметной области, и не всегда возможно найти разметчиков с необходимой компетенцией.
Решение: Предоставьте разметчикам обучающий материал и доступ к ресурсам, которые помогут им лучше понять контекст и особенности задачи. Также можно рассмотреть возможность обучения разметчиков внутри команды для повышения качества разметки.
5. Неоднородность и несбалансированность данных: В некоторых случаях разметка может быть неоднородной или несбалансированной, что может повлиять на качество обучения моделей.
Решение: Сделайте усилия для балансировки данных и устранения неоднородности. Это может включать сбор дополнительных данных для малочисленных классов или применение методов аугментации данных.
6. Переобучение разметчиков: Разметчики могут подстраиваться под обучающий набор данных, что приводит к переобучению и низкому качеству разметки новых данных.
Решение: Регулярно контролируйте качество разметки и предоставляйте разметчикам обратную связь. Используйте методы кросс-валидации, чтобы проверить стабильность и согласованность работы разметчиков.

Таким образом, успешная разметка текстовых данных требует внимания к деталям, тщательного планирования и постоянного контроля качества. Комбинация автоматических и ручных методов разметки может значительно улучшить процесс и обеспечить высокое качество данных для обучения моделей.
  • ❤ 1
  • 👍 1
Post #454 687
Post #453 840
📝💡Что такое CDC: преимущества и недостатки
CDC (Change Data Capture)
- технология, для отслеживания и захвата изменений данных, происходящих в источнике данных, что позволяет эффективно реплицировать или синхронизировать данные между различными системами без необходимости полной пересылки всей базы данных. Основная цель CDC состоит в том, чтобы определить и извлекать только те изменения данных, которые произошли с момента последнего захвата. Это делает процесс репликации данных более быстрым, эффективным и масштабируемым.
Преимущества CDC:
1. Эффективность репликации данных:
CDC позволяет пересылать только измененные данные, что существенно сокращает объем данных, требуемых для синхронизации между источником данных и целевой системой. Это уменьшает нагрузку на сеть и ускоряет процесс репликации.
2. Масштабируемость: технология CDC хорошо масштабируется, что позволяет обрабатывать большие объемы данных и высокую нагрузку.
3. Повышение надежности: CDC повышает надежность системы репликации, поскольку минимизирует вероятность ошибок при передаче и пересылке данных.
Недостатки CDC:
1. Дополнительная сложность:
внедрение CDC требует дополнительной настройки и инфраструктуры, что может увеличить сложность системы и подвергнуть ее дополнительным рискам отказа.
2. Зависимость от источника данных: CDC зависит от способности источника данных захватывать и предоставлять измененные данные. Если источник не поддерживает CDC, это может стать преградой для его внедрения.
3. Конфликты схем данных: При синхронизации между системами с разными схемами данных могут возникать конфликты, которые требуют дополнительной обработки и разрешения.
Таким образом, CDC представляет собой мощный инструмент для эффективного управления данными и репликации информации между различными системами. Однако его успешная реализация требует тщательного планирования, настройки и тестирования, чтобы минимизировать потенциальные риски и обеспечить надежную работу системы.
  • 👍 3
Post #452 958
😎📊Визуализация больше не требует кодинга
Flourish Studio — инструмент для создания интерактивных визуализаций данных без кодинга
С помощью этого инструмента можно создавать динамичные и привлекательные графики, диаграммы, карты и другие визуальные элементы
Flourish Studio предоставляет обширный выбор готовых шаблонов и анимаций, а также простой в использовании визуальный редактор. Он обеспечивает возможностью легко добавлять интерактивность и настраивать анимации.
Стоимость: #бесплатно (но есть платные тарифы).
Flourish Bring data to life with Flourish. Create data visualizations and interactive content – no coding needed. Engage, inspire, and tell your best data stories with ease.
  • 👍 1
  • 😁 1
Post #451 894
📝💡Несколько советов по подготовке датасетов для видеоаналитики
1. Не ставьте жесткие критерии для включения данных в сет:
обеспечьте разнообразие кадров, чтобы модель могла научиться обрабатывать разные ситуации. Чем выше разнообразие датасета, тем лучше модель будет генерализировать сущность детектируемого объекта.
2. Планируйте испытания в реальных условиях: подготовьте список объектов и контакты, где вы потенциально можете провести съемки.
3. Аннотируйте данные: при подготовке данных для видеоаналитики может быть полезно проаннотировать объекты или события на видеозаписи. Это поможет обучающимся моделям распознавать и классифицировать объекты более точно.
4. Синхронизация времени: убедитесь, что все камеры в системе синхронизированы по времени. Это поможет восстановить последовательность событий и связать действия, происходящие на разных камерах.
5. Разделение видео на сегменты: если ваша система обрабатывает большие видеофайлы, разделите их на более маленькие сегменты. Это поможет упростить обработку и анализ данных, а также улучшит производительность системы.
6. Метаданные видео: создайте метаданные для видеозаписей, включая временные метки, информацию о местоположении и другие соответствующие данные. Это поможет в организации и поиске видеофайлов и событий при последующем анализе.
Post #450 983
📊⚡️Генераторы данных в открытом доступе с открытым исходным кодом
Benerator - программное решение для генерации тестовых данных для тестирования и обучения моделей машинного обучения
DataFactory - это проект, который позволяет легко генерировать тестовые данные для заполнения базы данных, а также тестирования AI-моделей
MockNeat - предоставляет простой API, который позволяет разработчикам программно создавать данные в форматах json, xml, csv и sql.
Spawner - генератор данных для различных баз данных и AI-моделей. Он включает в себя множество типов полей, в том числе настраиваемых пользователем вручную
GitHub GitHub - rapiddweller/rapiddweller-benerator-ce: BENERATOR is a leading software solution to generate, obfuscate, pseudonymize… BENERATOR is a leading software solution to generate, obfuscate, pseudonymize and migrate data for development, testing, and training purposes with a model-driven approach. - rapiddweller/rapiddwel...
  • 👍 1
Post #449 974

Forwarded from Deep Dive 2 Deep Learning

📚📌Книги по NLP, которые актуальны в 2023 году
1. Speech and Language Processing - Книга, написанная двумя профессорами Стэнфордского университета, по обработке речи и языка содержит исчерпывающее введение в мир NLP. Она разбита на 3 раздела: Фундаментальные алгоритмы для НЛП, Приложения НЛП и Аннотирование лингвистической структуры
2. Foundations of Statistical Natural Language Processing - данная книга начинает с основ НЛП и постепенно погружает вас в математические аспекты, необходимые для обработки естественного языка, такие как вероятностные пространства, теорема Байеса, дисперсия и многие другие.
3. Pattern Recognition and Machine Learning - книга представляет собой детальное введение в область распознавания образов и машинного обучения.В конце каждой главы есть упражнение, подобранное таким образом, чтобы лучше объяснить читателю каждую концепцию.
4. Neural Network Methods in Natural Language Processing - в данной книге изучаются такие основы, как линейные модели, перцептроны, feed-forward, обучение нейронных сетей и тд.  Автор использовал математический подход для объяснения этих фундаментальных элементов вместе с практическими примерами.
5. Practical Natural Language Processing - в книге рассказывается о том, как NLP используется в реальном мире, о конвейере моделей NLP, а также о текстовых данных и примерах использования, таких как чат-боты типа ChatGPT.
Post #448 792

Forwarded from Алексей Чернобровов

▪️InteriorAi - позволяет пользователям создавать свежие образы и даже новые элементы для своих интерьеров. В качестве исходного материала приложение использует 2D-изображение интерьера, будь то загруженное из Интернета или сделанное фото. Приложение не бесплатное, но в пробной лицензии сделать 5 бесплатных рендеров.
▪️RoomGPT — недавно разработанная модель искусственного интеллекта, которая помогает в создании дизайна комнат. Room GPT является бесплатным сервисом. Но из-за наплыва желающих разработчики пока установили для пользователей лимит по три генерации в сутки.
▪️Planner 5D — условно-бесплатное веб-приложение, также доступное на мобильных устройствах, предназначенное для проектирования помещений и дизайна интерьера в виде 2D и 3D моделей. В основе сервиса лежит идея предоставления людям без профессиональных инженерных и архитектурных навыков возможности создать наглядный план помещения с трёхмерной визуализацией.
  • 👍 1
Post #447 723
😎Датасеты, заслуживающие внимания
IMDB reviews — 25 000 отзывов на фильмы в тренировочном наборе и 25 000 в тестовом.
GTSRB (German traffic sign recognition benchmark) Dataset — 50 000 изображений 43 дорожных знаков
Breast Histopathology Images Dataset — датасет содержит изображения образцов рака молочной железы
Cityscapes Dataset — содержит высококачественные аннотации видеопоследовательностей улиц разных городов
Обнаружение мошенничества с кредитными картами - датасет по анонимным транзакциям кредитных карт, помеченные как мошеннические или подлинные.
Европейская футбольная база - Больше 25 тысяч матчей, атрибуты игроков и команд для европейского профессионального футбола
Распознавание цветов - набор данных содержит 4242 изображения цветов. Сбор данных основан на данных Flickr, изображениях Google и «Яндекса»
Ежедневная рыночная цена каждой криптовалюты -  исторические цены на криптовалюту для всех токенов
ai.stanford.edu Large Movie Review Dataset (IMDB) — Andrew Maas Large Movie Review Dataset for binary sentiment classification — 50,000 polarized IMDB reviews introduced in Maas et al., ACL 2011. Standard benchmark in BERT, ULMFiT, RoBERTa, XLNet, and other landmark NLP papers.
  • 👍 3
  • 👏 2
Post #446 787
😎💥В открытом доступе появился репозиторий YouTube-ASL
В данном репозитории представлена информация о наборе данных YouTube-ASL, который представляет собой обширный датасет с открытым исходным кодом. Он содержит видеоролики, на которых демонстрируется американский жестовый язык с английскими субтитрами.
Данный набор данных включает в себя 11 093 отснятого видео на американском жестовом языке (ASL) и имеет общую продолжительность 984 часа отснятого материала. Кроме того, в наборе присутствует 610 193 английских субтитров.
В репозитории представлена ссылка на текстовый документ с ID данных видеоматериалов.
Данный репозиторий находится по ссылке: https://github.com/google-research/google-research/tree/master/youtube_asl
GitHub google-research/youtube_asl at master · google-research/google-research Google Research. Contribute to google-research/google-research development by creating an account on GitHub.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →