TGViewer
Channel Public Channel
Аналитик данных

Аналитик данных

@dataanlitics

Аналитика данных, Дата Сеанс

@workakkk - по всем вопросам
Subscribers
6.26K
Photos
259
Videos
37
Links
239

Showing posts older than #62 · Back to latest

Older Posts 14 shown
Post #59 1.58K
▶️Генератор изображений Kandinsky стал быстрее, умнее и удобнее

⏩Разработчики Сбера презентовали обновление модели генерации изображений Kandinsky до версии 3.1. В сравнении с предшественницей она стала значительно быстрее, проще в использовании за счёт сокращения вводимого запроса, а также появилась возможность работы с уже имеющимися изображениями.

⏩В сравнении с Kandinsky 3.0 новую модель удалось ускорить почти в 20 раз — генерация происходит всего за четыре прохода через U-Net вместо 50 шагов ранее. На скорость повлиял тот факт, что нейросеть из диффузионной модели превратилась в GAN, обученную с хорошей начальной инициализацией весов после претрейна. Впрочем, ценой этого ускорения стало качество понимания текста.

⏩Чтобы уменьшить необходимость вводить слишком подробные текстовые запросы для получения детализированного изображения, разработчики встроили функцию бьютификации — способ улучшения и добавления деталей к запросу пользователя с помощью большой языковой модели (LLM). Фактически к описанию пользователя автоматически добавляется инструкция с просьбой улучшить запрос.

⏩Ещё одним улучшением стала возможность генерации изображения не только по текстовому запросу, но и/или с помощью визуальной подсказки в виде загружаемого изображения. Таким образом, можно редактировать и изменять уже имеющуюся картинку.

⏩Было также улучшено восстановление изображения по исходному описанию, что позволяет заменять один объект на другой. Кроме того, появилась возможность получать изображения в разрешении 4K, для чего была обучена диффузионная модель повышения разрешения KandiSuperRes.

📎 Подробнее

Аналитика данных
  • 👍 5
  • ❤ 3
Post #58 1.84K
🌟 Развертывание ML-модели на AWS Lambda

Держите годный контент, поможет понять, какие инструменты используются в реальном ML

⏩Здесь рассматривается, как развернуть модель машинного обучения (ML) на AWS Lambda с помощью Serverless Framework и выполнить ее с помощью Boto3.
Параллельно обсуждается создание CI/CD-конвейера с помощью GitHub Actions для автоматизации процесса развертывания и запуска сквозных тестов.

📎 Статья

Аналитика данных
  • 👍 6
  • 🔥 1
Post #57 5.38K
🖥 Sqlelf

Инструмент, использующий функциональность виртуальной таблиц Sqlite, позволяющий исследовать объекты Linux ELF с помощью SQL.

ELF (англ. Executable and Linking Format — это формат исполнимых и компонуемых файлов) — формат исполняемых двоичных файлов, используемый во многих современных UNIX-подобных операционных системах, таких как FreeBSD, Linux, Solaris и др.

Традиционно изучение файлов ELF ограничивалось такими инструментами, как objdump или readelf. Несмотря на то, что эти инструменты обладают широкими возможностями синтаксического анализа, формат вывода и возможность задавать исследовательские функции инструментов довольно ограничены.

▪ Github

Аналитика данных
  • 🔥 5
  • 👍 2
  • ❤ 1
Post #56 1.89K
📌Временная сложность разных ML-алгоритмов

И вспомним про некоторые алгоритмы

⏩Логистическая регрессия
Где применять — там, где требуется несложная классификация малого числа объектов на малое число классов.

⏩K-means
Может сгруппировать объекты по степени похожести.
Где применять — поиск закономерностей, классификация объектов по нескольким параметрам. Работа с объектами, которые можно описывать набором переменных.

⏩Метод опорных векторов (SVM)
Пытается построить такую линию, чтобы самым точным образом разделить между собой разные типы объектов.
Где применять — классификация объектов.

⏩Байесовский классификатор
Определяет класс, к которому принадлежит объект. В основе — расчет вероятности, с которой объект относится к тому или иному типу данных.
Где применять — в задачах классификации, конечно же. Например, классическая задача — сказать, относится ли письмо к спаму или нет.

📎 А вот подробная статья по самым популярным ML-алгоритмам

Аналитика данных
  • 🔥 8
  • ❤ 5
  • 👍 3
Post #55 1.66K
#вакансия #ищу сотрудника #analyst #productanalyst #удаленка #PostgreSQL #Python

🔍 Ищем аналитика в #Wiam Group
💰Вилка: 200-350 т.р.

Компания Wiam group международная финтех компания, основанная в 2019 году, которая совершенствует технологии в сфере кредитования и разрабатывает программное обеспечение.

📌Что надо будет делать:
- Проводить анализ личного кабинета пользователей;
- Анализировать воронки и пути пользователей в продукте;
- Искать точки роста для увеличения конверсии;
- Участвовать в подготовке и оценке продуктовых А/Б тестов;
- Оценивать результаты запуска новых функций продукта;
- Готовить ТЗ для команды разработки на передачу событий аналитики.


📌Мы ожидаем:
- Опыт работы продуктовым/data/web- аналитиком от 2-х лет;
- Опыт работы с Python и SQL (у нас PostgreSQL);
- Глубокое знание математической статистики и теории вероятностей;
- Уверенное знание флоу A/B-тестирования (дизайн, контроль проведения, способы проверки статистической значимости, подведение итоговых результатов);
- Опыт работы с инструментами web-аналитики (Google Tag Manager, Яндекс.Метрика, Google Analytics).



📌Будет плюсом:
- Опыт визуализации данных в BI-системах (у нас Tableau);
- Знание базовых ML-алгоритмов;
- Опыт написания техзаданий;
- Опыт работы в финтехе.


📌Мы предлагаем:
- Полностью удаленный формат работы из любой точки мира;
- График работы с понедельника по пятницу с гибким началом и окончанием рабочего дня в зависимости от проекта в работе;
- Возможности профессионального развития;
- Отсутствие тотальной бюрократии и микроменеджмента;
- Фиксированный оклад;
- Заработная плата обсуждается по итогам собеседования;
- Оформление по договору с самозанятыми или с ИП.


Этапы отбора: 1) собеседование с HR; 2) собеседование с руководителем отдела аналитики.

Интересна данная вакансия?

📮Контакт: @rm_julia

Аналитика данных
  • ❤ 3
  • 👍 3
  • 👨‍💻 2
Post #54 3.03K
Shpargalka_po_Python_Data_Science.pdf1.4 MB
✍️ Шпаргалка Python для Data Science

Содержит:
▫️основы Python;
▫️инструкции по Jupyter Notebook;
▫️основы NumPy;
▫️основы линейной алгебры на примере NumPy;
▫️основы Pandas;
▫️примеры работы с Scikit-Learn;
▫️библиотеки для визуализации данных Matplotlib, Seaborn и Bokeh.
  • 👍 7
  • 🔥 6
  • ❤ 2
  • 💩 1
Post #53 2K
📌Подборка годных ресурсов для Data Science

Держите полезности)

Книги
⏩Дж. Вандер Плас (Jake Wander Plas) — «Python для сложных задач: наука о данных и машинное обучение»
("Python Data Science Handbook: Essential Tools for Working with Data")

⏩Джоэл Грас (Joel Grus) — «Data Science: Наука о данных с нуля»
("Data Science from Scratch: First Principles with Python")

⏩Себастьян Рашка Вахид Мирджалили (Sebastian Raschka, Vahid Mirjalili) - "Машинное и глубокое обучение с использованием Python, scikit-learn и TensorFlow2"
("Machine Learning and Deep Learning with Python, scikit-learn, and TensorFlow2")


Бесплатные онлайн-курсы
⏩"Анализ данных" — [Stepik]

⏩"Machine Learning" от AndrewNg — [Coursera]

📎Кстати, вот roadmap c превью

Аналитика данных
  • 👍 7
  • 🔥 3
  • ❤ 1
Post #48 2.26K
📌10 библиотек Python для Data Science

⏩SciPy
SciPy расширяет возможности NumPy. SciPy похожа на Matlab. Включает методы линейной алгебры и методы для работы с вероятностными распределениями, интегральным исчислением и преобразованиями Фурье.

⏩Scikit-learn
Основана на NumPy и SciPy. В ней есть алгоритмы для машинного обучения и интеллектуального анализа данных: кластеризации, регрессии и классификации.

⏩TensorFlow
Благодаря этой библиотеке Google может определять объекты на фотографиях, а приложение для распознавания голоса — понимать речь.

⏩Scrapy
Библиотека используется для создания ботов-пауков, которые сканируют страницы сайтов и собирают структурированные данные: цены, контактную информацию и URL-адреса. Кроме этого, Scrapy может извлекать данные из API.

⏩NLTK (Natural Language Toolkit)
Набор библиотек для обработки естественного языка. Основные функции: разметка текста, определение именованных объектов, отображение синтаксического дерева, раскрывающего части речи и зависимости.

⏩Pattern
Сочетает плюсы Scrapy и NLTK и предназначена для извлечения данных в интернете, NLP, ML и анализа социальных сетей. Среди инструментов есть поисковик, API для Google, Twitter и Wikipedia и алгоритмы текстового анализа.

⏩Seaborn
Библиотека более высокого уровня, чем matplotlib. С ее помощью проще создавать специфическую визуализацию: тепловые карты, временные ряды и скрипичные диаграммы.

⏩Bokeh
Создает интерактивные и масштабируемые графики в браузерах, используя виджеты JavaScript. Это могут быть от стандартных диаграмм до сложных кастомизированных схем.

⏩Basemap
Basemap используется для создания карт. На ее основе сделана библиотека Folium, с помощью которой создают интерактивные карты в интернете.

⏩NetworkX
Используется для создания и анализа графов и сетевых структур. Предназначена для работы со стандартными и нестандартными форматами данных.

Аналитика данных
  • 👍 12
  • ❤ 4
Post #47 1.62K
🚀 GPTFast — это библиотека, которая ускоряет работу с моделями Transformers в 6-7 раз.

Создатели проекта объясняют, что GPTFast изначально представлял собой набор методов, разработанных командой PyTorch, для ускорения инференса модели Llama-2-7b. Эти методы были обобщены на другие модели Hugging Face.

Чтобы начать использовать GPTFast, необходимо:
▫️ убедиться, что используется Python версии 3.10 или выше,
▫️ иметь устройство с поддержкой Cuda,
▫️ настроить виртуальное окружение,
▫️ установить библиотеку с помощью команды pip install gptfast.

https://github.com/MDK8888/GPTFast
  • 🔥 4
  • 👍 2
  • ❤ 1
Post #46 1.68K
🚀 Устали тратить “слишком много времени” на изучение данных перед обучением моделей машинного обучения?

Вот инструмент для изучения данных с открытым исходным кодом, который облегчит вашу жизнь ↓

https://www.realworldml.net/blog/fast-and-easy-data-exploration-for-machine-learning
www.realworldml.net Fast And Easy Data Exploration For Machine Learning
  • 👍 2
Post #45 1.72K
🖥 OpenAI опубликовали код отладчика для моделей Transformer

Transformer Debugger помогает ответить на вопрос: «Почему модель выдала токен A вместо токена B для этого промпта?».

Сейчас Transformer Debugger включает в себя:
▫️Neuron viewer — React-приложение для вывода информации о компонентах модели.
▫️Activation server — сервер, который позволяет проводить инференс и предоставляет данные для анализа.
▫️Models — библиотека для инференса моделей GPT-2.
▫️Примеры датасетов.

В репозитории можно найти подробные инструкции, как пользоваться инструментом.

GitHub
  • 👍 3
  • 🔥 2
  • ❤ 1
Post #44 1.67K
👀 ИИ-моделям дали подобие периферического зрения

Исследователи из Массачусетского технологического института (MIT) создали набор изображений, который позволил им симулировать периферическое зрение у моделей машинного обучения. Это улучшило способность моделей обнаруживать объекты на зрительной периферии. Впрочем, до уровня людей они так и не добрались.

❓Специалисты использовали такую технику, как тайловое текстурирование (texture tiling), чтобы преобразовать изображения и сымитировать в них потерю информацию, происходящую на периферическом зрении. Технику немного модифицировали и применили для генерации большого датасета.

Исследователи надеются, что их работа поможет, например, в создании систем искусственного интеллекта, которые будут предупреждать водителей о потенциально незаметных опасностях.

🔗 Читать статью
  • 👍 3
  • ❤ 1
Post #43 1.73K
🙂 Нейросеть от Яндекса для анализа эмоций клиентов

Нейросеть-эмпат от Yandex Cloud сможет помочь бизнесу лучше понять эмоции клиентов. Новая ML-модель уже может определить негатив, неформальные высказывания и нецензурную лексику, а также пол спикера и его фразы в диалоге. Это позволяет улучшить качество аналитики телефонных разговоров, а также лучше адаптировать работу кол-центров под каждого клиента и оперативно реагировать на внештатные ситуации во время диалога.

В будущем алгоритм заработает в связке с YandexGPT: вместе нейросети смогут распознать более сложные эмоции, в частности — сарказм.

Новая ML-модель от Yandex Cloud работает в потоковом режиме, расшифровка и анализ эмоций происходит сразу во время разговора. Например, если абонент негативно общается с голосовым помощником, нейросеть может передать информацию об этом во внутреннюю систему заказчика, которая автоматически переключит его на сотрудника кол-центра. Если оператор нагрубил клиенту, эта система оповестит менеджмент о проблемах во время разговора.

🌟 Алгоритм может определять эмоции не только по содержанию речи спикера, но и по голосу, по скорости речи, высоте,тембру и другим параметрам. Нейросеть определяет пол участников разговора и поддерживает технологию speaker labeling – она отмечает, кому принадлежит та или иная реплика. Это позволяет полноценно работать с одноканальными звуковыми дорожками: например, при записи с диктофона или при технологических ограничениях виртуальной АТС.

Хмм, посмотрим, но задумка неплохая ⚡️

Аналитика данных
  • ❤ 2
  • 👍 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →