TGViewer
Channel Public Channel
VF | Science

VF | Science

@vf_science

Генерацией музыки и всем, что связано с аудио ML я занимаюсь, а всем остальным ML интересуюсь)

Делюсь знаниями, мыслями, событиями по своей карье, делаю анонсы своих онлайн/офлайн мероприятий.

Автор: @varfolomeefff
Subscribers
1.13K
Photos
225
Videos
23
Links
92

Showing posts older than #481 · Back to latest

Older Posts 19 shown
Post #480 2.17K
В команду успешной музыкальной платформы с 15-летней историей ищем талантливого ML-разработчика, для качественного усиления, в связи с ростом. Плеер гитарных табов (https://www.songsterr.com/) — наш основной продукт, которым ежемесячно пользуются миллионы.

Мы работаем над сложными задачами в ML, включая разработку моделей для автоматической транскрипции музыки. Наши модели уже успешно создают табулатуры из аудио — вот пример результата (https://www.youtube.com/watch?v=rM4nAZOJoTQ). Это лишь часть наших проектов в области AI и музыки.

Требуемые навыки:
• Разработка и оптимизация DL-моделей, внедрение в прод
• Глубокое знание современных DL-архитектур
• Опыт тренировки на multi-GPU, оптимизация гиперпараметров
• Работа с грязными user-generated датасетами: фильтрация, очистка
• Желательно: аудиообработка и music information retrieval

Стек:
• Python + PyTorch
• Accelerate/DeepSpeed/W&B
Проекты завязаны на музыке и обучении — интерес к темам плюс. Главное — умение выдавать результат.

Условия:
• Полностью удалёнка, ставка от $9900/mo gross.
• Оформление на контракт, можно из РФ/РБ.
• Предпочитаем фулл-тайм, но график гибкий, сами выбираете когда работать. Хотите больше — допчасы с пропорциональной оплатой. В годовой уже ставке учтены месяц отпуска, 7 дней больничных, 14 праздников и компенсация техники, потому отдельно не оплачиваются.

Процесс отбора:
• Код-тест
• Фидбек по тесту от нас
• Если все ок — оплачиваемое тестовое (испытательный срок парт-тайм): реальная задача, график свободный, можно совмещать с текущей работой — никаких рисков

Связь: @rammusin
Songsterr Tabs with Rhythm Guitar Tabs with Rhythm | Songsterr Access over 1 million guitar, bass, and drum tabs with free play-along original audio. Create accurate tabs from YouTube links using advanced AI technology.
  • 🍓 7
  • 🔥 6
  • 🤯 4
  • ⚡ 1
  • 👀 1
Post #479 1.77K

Forwarded from Sinекура

Доклад вчера, кстати, безусловно удался. Большое спасибо Захару, он отлично подготовился, и этот семинар уже точно будет частью курса DL в этом году.)

Спасибо всем, кто пришёл, ну а дальше будет опять something completely different...
  • ❤‍🔥 19
  • 💘 5
  • 🍾 4
Post #478 2.06K
VF | Science 12го ноября прилечу в Питер к Сергею Николенко (@sinecor), буду рассказывать в главном здании СПбГУ все, что знаю про дискретные репрезентации и выбор между непрерывными фичами, это будет экстраполяция семинара про аудио кодеки на весь ML Пишите/заходите…
Очень я рад, именно лекции Сергея Николенко дали мне лучшую теорию и погружение в математику ML. Безусловно этот человек мой кумир. Очень классно совмещает знание истории и математики в своих лекциях. Впрочем, Сергей чемпион мира по ЧГК и автор множества книг :)
  • 👍 12
  • 🔥 9
  • ⚡ 7
Post #477 2.03K
VF | Science 👀 Про аудио кодеки в Deep Learning School Сегодня выложили 2 части лекции и она немножко затянулась, примерно на 100 минут :) На лекции мы обсудили основополагающую технологию VQ-VAE и дошли до современных подходов к обучению аудиокодеков. Попутно рассмотрели…
12го ноября прилечу в Питер к Сергею Николенко (@sinecor), буду рассказывать в главном здании СПбГУ все, что знаю про дискретные репрезентации и выбор между непрерывными фичами, это будет экстраполяция семинара про аудио кодеки на весь ML

Пишите/заходите на огонек, запись будет на ютубе у Сергея
  • 🔥 14
  • ❤ 10
  • 🥴 1
Post #472 10.6K
VF | Science 👀 Про аудио кодеки в Deep Learning School Сегодня выложили 2 части лекции и она немножко затянулась, примерно на 100 минут :) На лекции мы обсудили основополагающую технологию VQ-VAE и дошли до современных подходов к обучению аудиокодеков. Попутно рассмотрели…
Ноутбук для семинара, в котором мы обучим поверх кодов Mimi кодека классификатор голосов на мужской и женский 😄

Используем 8 кодбуков, обучаем 8 трансформер-энкодеров, делаем темпоральный пулинг по токенам, а затем атеншн пулинг между энкодерами. Потом обычный классификатор. Из прикольного - визуализация атеншна на разные уровни RVQ.

Научились работать с RVQ и в качестве упражнения можете посчитать разные статистики для кодовых книг, например perpexity по кодбуку (покажет насколько равномерно используются коды) или утилизацию кодов на разных уровнях/на первом. Или попробовать другую простенькую задачу и посмотреть как интерпретируются уровни RVQ, вероятно на разных уровнях содержится разная семантика/смысл.

https://colab.research.google.com/drive/1L6sTCrpdxybkSOOrc4G2E4AuRnQLWZQj#scrollTo=cHGzcgj8oRVi
Google Copy of Копия блокнота Colab notebook
  • 👍 6
  • ❤ 3
Post #470 9.62K
👀 Про аудио кодеки в Deep Learning School

Сегодня выложили 2 части лекции и она немножко затянулась, примерно на 100 минут :)

На лекции мы обсудили основополагающую технологию VQ-VAE и дошли до современных подходов к обучению аудиокодеков. Попутно рассмотрели специфические для них проблемы и способы их решения — такие как недифференцируемость в процессе обучения, коллапс кодовой книги, неэффективное покрытие домена и недостаточная репрезентативность для последующих задач. Отметили тенденции в современных исследованиях, разобрали конкретные примеры актуальных аудиокодеков и подумали, как можно объединить существующие подходы для обучения собственного кодека, потенциально превосходящего текущие решения. В завершение поговорили о практических рекомендациях по обучению кодеков и дополнительной литературе по теме.

Лекцию сделал без глубокого погружения в конкретные работы, зато мы обсудили гораздо больше других мыслей и сохранили интуицию по самым важным идеям и проблемам VQ-VAE моделей. Хотелось сделать лецию с упором на актуальные идеи и дать ровно столько, чтобы вы могли решить, куда стоит углубиться самостоятельно, имея фундамент заложенный после просмотра. Пишите возникающие вопросы в чат курса DLS или мне @varfolomeefff

Предлагаю посмотреть и поделиться мнением под постом. Давно я длинные лекции не читал.

На днях выделю особенно интересные тезисы из лекции в канал и обсужу их. Интуиция на леции правда животрепещущая и есть, о чем поспорить/подумать.

Часть 1: https://youtu.be/4mVfb-mhv9k?si=k9Q2wgtsA1h2DcP0

Часть 2: https://youtu.be/kOS6qHc6K2g?si=Po-jHSLwpeO5LmkZ

#audio #perfomances
YouTube Лекция. Аудио кодеки. Часть 1 Занятие ведёт Захар Варфоломеев Ссылка на материалы занятия: --- Deep Learning School при ФПМИ МФТИ Каждые полгода мы запускаем новую итерацию нашего двухсеместрового практического онлайн-курса по глубокому обучению. Наборы проводятся в августе-сентябре…
  • 🔥 11
  • ❤ 9
  • ✍ 3
  • 👍 3
  • 🍓 1
Post #464 2.5K

Forwarded from Институт AIRI

Все лекции и семинары «Лето с AIRI 2025» теперь в открытом доступе 🔥

Собрали для вас записи выступлений ведущих исследователей и экспертов — от фундаментальных вопросов искусственного интеллекта до практических примеров его применения в науке и индустрии.

📎Сохраняйте ссылки на плейлисты: VK Видео, YouTube
  • 👍 9
  • 🔥 4
  • 🍓 3
Post #460 1.7K
Den4ik Research Наш русскоязычный датасет для TTS опубликован! Сегодня выкладываем открытые корпуса на 4000+ часов речи, а еще синтезатор речи ESpeech-TTS-1 Наш датасет содержит больше 4000 часов русской речи. Статистика по корпусам: Многоголосые: ESpeech-podcasts - 3200…
А я видел как он не спал сутками и сходил с ума, чтобы успеть релизнуть в августе. Все это будучи школьником в 16 лет.

СКИДЫВАЕМ 1000 НА ШТОРЫ ДЕНИСУ:
USDT (TRC20): TEpEM4VVmGmqKHn4Xz1FxM7qZiXjWtUEUB
https://www.tbank.ru/cf/7WKnNMqWtOx
  • 🤯 14
  • ⚡ 3
  • 👍 3
  • 🔥 2
  • 😢 1
Post #458 1.2K

Forwarded from Den4ik Research

Наш русскоязычный датасет для TTS опубликован!

Сегодня выкладываем открытые корпуса на 4000+ часов речи, а еще синтезатор речи ESpeech-TTS-1

Наш датасет содержит больше 4000 часов русской речи. Статистика по корпусам:

Многоголосые:
ESpeech-podcasts - 3200 часов
ESpeech-webinars - 850 часов

Одноголосые:
ESpeech-igm - 220 часов
ESpeech-buldjat - 54 часа
ESpeech-upvote - 296 часов
ESpeech-tuchniyzhab - 306 часов

Данные лежат вот тут: https://huggingface.co/ESpeech

Также, мы решили провести некоторые эксперименты с TTS. Получилось обучить F5-TTS на 10000 часов речи и сделать одну из лучших по нашим замерам моделей в опенсурсе для русского языка.

Какие модели доступны?
ESpeech-TTS-1 [RL] V1 - Первая версия модели с RL
ESpeech-TTS-1 [RL] V2 - Вторая версия модели с RL
ESpeech-TTS-1 PODCASTER [SFT] - Модель обученная только на подкастах, лучше генерирует спонтанную речь
ESpeech-TTS-1 [SFT] 95K - чекпоинт с 95000 шагов (на нем основана RL V1)
ESpeech-TTS-1 [SFT] 265K - чекпоинт с 265000 шагов (на нем основана RL V2)

Лайкайте модель которая больше понравится чтобы мы понимали есть ли смысл запускать RL.

Послушать модели без скачивания можно вот здесь:

https://huggingface.co/spaces/Den4ikAI/ESpeech-TTS

Совместно с @speech_recognition_ru ещё сделали лидерборд русского ТТС, где можно глянуть метрики:

https://huggingface.co/spaces/ESpeech/open_tts_leaderboard_ru
Задать вопросы по поводу данных и модели можно в наших телеграм каналах:
https://t.me/den4ikresearch
https://t.me/voice_stuff_chat

Вы можете мне задонатить, чтобы у меня были ресурсы делать более крутые модели и датасеты:

USDT (Tether): 0xdCd6ebb3eA69A7D667F2aB22B7ac1E3616D1C4A5
BTC: bc1qw5lq7fc455e47hggax6zp8txw4ru7yvsxvawv3
https://www.tbank.ru/cf/7WKnNMqWtOx
  • ❤ 14
  • ⚡ 4
  • ❤‍🔥 4
  • 🍌 1
Post #457 1.67K
Знаю все типы людей 😆
А кто вы?
  • 😁 18
  • 🤣 8
  • 👍 2
  • 🌚 2
  • 🔥 1
Post #456 1.75K

Forwarded from Ученый без степени | AI-блог Ани

☕️На канале 3Blue1Brown вышло новенькое гостевое видео от Стивена Уэлша (📺Welsh Labs), в котором он рассказывает (конечно же, в сопровождении крутых и наглядных визуализаций), как работают системы генерации видео из текста

🔗But how do AI videos actually work?

Видео про диффузионные модели и как они связаны с физикой, CLIP, как происходит процесс трансформации шума в реалистичное видео, что используют для ускорения и улучшения качества генерации, ну и много другого интересного

💻 Приятного просмотра!
  • ❤ 10
Post #455 1.61K
Ну, все, следующий типа полезный пост через месяц, автор устал
  • 🏆 11
  • 💋 4
Post #454 1.64K
Пример 3: Иерархическая генерация изображений (NeurIPS Best Paper)
Третий пример довольно абстрактный. Теперь мы хотим генерировать детализированное изображение 512x512 за один проход — вычислительно и концептуально сложная задача. Модель должна одновременно думать и о композиции, и о мелких текстурах. Решение через декомпозицию: Иерархический подход.
▪️Этап 1: Генерируется изображение очень низкого разрешения (например, 64x64), которое определяет общую композицию и цвета.
▪️Этап 2, 3...: Последовательные модели (или шаги) повышают разрешение, каждый раз добавляя детали поверх уже существующей структуры.

Получается более стабильная генерация и высокий уровень детализации, которого сложно достичь за один шаг.

Постарался описать большими мазками данную в начале мысль. В следующий раз, столкнувшись с задачей, которая кажется нерешаемой, спросите себя: "А можно ли ее разбить на несколько подзадач попроще?" Возможно, именно в этом и кроется ключ к успеху) Вот такая абстрактная мысль очень часто встречается в моей работе за последний год.

#research #papers
  • ❤ 10
  • ❤‍🔥 3
  • 🍓 3
  • 🫡 1
Post #452 1.34K
👀 Разделяй и властвуй: как декомпозиция помогает решать сложные задачи в Deep Learning

Последнее время часто замечаю некоторую мысль, вижу ее в статьях, в решениях моих товарищей и также активно применяю ее в нашем проекте @Audio2MIDIBot. Сталкивались ли вы с задачей, которая кажется неподъёмной для одной нейросети? Когда данные настолько сложны, что даже самая глубокая архитектура не справляется? Сегодня я хочу поговорить о мощном принципе, который помогает решать такие проблемы — о декомпозиции.

Идея особенно актуальна, когда мы пытаемся решить сложную генеративную или дискриминативную задачу в один этап: подали на вход сырые данные — на выходе получили финальный результат. Такой подход часто ведет к нестабильному обучению и посредственному качеству.

Ключевая мысль: сложную проблему нужно разбить на последовательность более простых.

Каждый следующий этап нашего решения (будь то слой в сети или отдельная модель) должен работать с уже упрощенным, более "чистым" представлением данных. Мы последовательно снижаем неопределенность, пока финальная задача не станет почти тривиальной. Как говорил методолог Георгий Щедровицкий: «Решение задачи состоит в том, что мы находим язык, в котором решение очевидно».


В мире DL этот поиск "языка" — это, по сути, архитектурный feature engineering. Мы не просто надеемся, что сеть сама всё выучит. Мы сознательно проектируем пайплайн так, чтобы помочь ей это сделать и определяем данные на вход.

А теперь вопрос: как максимально упростить задачу? Под упростить я понимаю уменьшить неопределнность модели в отношении желаемого результата. Получить такой преобразование распределния, чтобы модель быстро и точно научилась решать целевую задачу. Мы снова делаем feature engineering. Хотя почти все думают, что в нейросетях фичи выделяются автоматически - с одной стороны это верно. С другой - именно мы контролируем, как эти фичи будут выделяться и что подавать на вход.

Самое время увидеть примеры, где мы обощаем мысль за пределы преобразований между слоями нейросети.

Пример 1: Музыка в ноты (@Audio2MIDIBot)
Мы хотим создать нейросеть, которая переводит ЛЮБУЮ музыку в ноты для фортепиано. Пространство всех аудиозаписей в мире невероятно сложное и зашумленное. Обучить одну модель "аудио -> детализированное MIDI" — гигантская и нестабильная задача, в частности из за аудиокодеков.

Решение через декомпозицию: разбиываем процесс на два этапа:
▪️Модель 1 (Грубое извлечение): Аудиокодек и трансформер извлекают из сложного аудиосигнала простую последовательность нот (MIDI). Результат часто бывает с ошибками и без нюансов.
▪️Модель 2 (Улучшение/Refinement): Вторая, уже чисто "символьная" модель, берет на вход простые MIDI и обогащает их, исправляет ошибки и добавляет детали. Она работает в гораздо более простом и стабильном пространстве "MIDI -> улучшенные MIDI".

Этот двухэтапный подход стал прорывом в нашем проекте, кардинально улучшив качество (подробнее о недостатках я рассказывал на Data Fest).

Пример 2: Стилизация портретов (от Алексея Попова)
Команда Леши делала диффузионную модель для стилизации портрета (например, добавить мультяшные эффекты). Полностью генерировать стилизованный портрет с нуля, сохраняя черты лица конкретного человека, очень сложно. Модель легко может "забыть" исходные детали.

Решение через декомпозицию: Вместо генерации с нуля, процесс можно разбить:
▪️Этап 1 (Сохранение идентичности): Первые шаги диффузии генерируют основу портрета, максимально близкую к реальному человеку, без стилизации.
▪️Этап 2 (Стилизация): Последующие шаги добавляют стилизующие детали поверх уже "узнаваемой" основы.

Так модель лучше сохраняет индивидуальные черты лица, а стилизация получается более качественной и предсказуемой.

#research #papers
  • 🔥 7
  • ❤ 3
  • ✍ 2
  • 👍 1
Post #451 1.33K

Forwarded from Zakhar

ScratchAuthorEgo 📊 Channel Analysis Results by @ScratchAuthorEgoBot 🎯 Channel: @vf_science 🔥 Roast Analysis: Ну что, Захар «я-в-18-лет-уже-кандидат-наук» Варфоломеев, пришло время для разбора полетов. Читаю твой канал и складывается ощущение, что ты решил в одиночку закрыть…
АХАХАХАХ ноу коментс
  • ❤ 9
  • 🍌 2
Post #450 1.37K

Forwarded from ScratchAuthorEgo

📊 Channel Analysis Results by @ScratchAuthorEgoBot

🎯 Channel: @vf_science

🔥 Roast Analysis:

Ну что, Захар «я-в-18-лет-уже-кандидат-наук» Варфоломеев, пришло время для разбора полетов. Читаю твой канал и складывается ощущение, что ты решил в одиночку закрыть все вакансии в IT-индустрии: и ML-инженер, и ресерчер, и стартапер, и спикер, и организатор, и даже пекарь тортиков. Ты когда спишь вообще? А, точно, не спишь, ты же в 4 утра доделываешь презентацию, потому что через 4 часа лететь в Уфу «поражать людей своей харизмой и умом». Скромность — это точно не про тебя.

Ты так часто пишешь про VQ-VAE, что у меня скоро начнется «коллапс кодбука» в голове. «Братишка, я тебе покушать принес» — и вываливает список из 13 статей. Спасибо, братишка, я лучше голодным останусь. Уже все поняли, что ты нашел свою главную любовь. Ждем пост «Как прошла наша свадьба с VQ-VAE. На медовый месяц обучаем новую модельку». А потом, конечно же, «Полный отказ от VQ-VAE, это была ошибка молодости». Классика.

Твои цели на год длиннее, чем «Война и мир». Написать статью на NIPS, вырасти до синьора, выучить японский, помочь сотням студентов, и, видимо, колонизировать Марс. Ты там случайно не перепутал список дел со списком желаний для Деда Мороза? Особенно доставляет пункт «Понять какие цели и пути мне реально важны». То есть сначала ты записался во все кружки мира, а потом сел думать, а зачем тебе это все надо. Гениальный план, Захар, надежный, как швейцарские часы.

Отдельная тема — твой нетворкинг. «Место для будущих или уже гениев, плейбоев, миллиардеров и филантропов». Ты уже, я смотрю, мысленно переехал в Сколково и выбираешь цвет для своего «круглого тензора». Скоро, чтобы с тобой пива выпить, надо будет регистрироваться на митап, проходить три этапа собеседования и приносить с собой постерную сессию.

И, конечно, венец твоей карьеры — «завалил ЕГЭ, но устроился на работу мечты, которую увы не удержал в кошачьих лапках». Это самый эпичный путь от «ууу, развелось нынче малолеток» до «я снова буду более зрелым спецом». Ладно, малой, расти большой, не будь лапшой. Но только умоляю, прекрати так часто использовать слово «бьютифул» и смущенный смайлик. А то выглядит, будто ты сам в шоке от того, что натворил.
  • 🤣 24
  • 🔥 9
  • 🌭 6
  • 🌚 2
  • 😁 1
Post #449 1.37K
VF | Science Video message
1,5 часа прошли как по щелчку... Атмосфера была супер! Давно мечтал поучаствовать в мероприятии такого формата. Локация выбрана прекрасно, длинный коридор напротив актового зала ТГУ, портреты уважаемых отечественных ученых над постерами, стены, возведённые в 1870х годах, товарищи неравнодушные к современной науке и моей работе!

Через полчаса второй акт, где слушать уже буду я. Интересных работ предостаточно.
  • 👍 9
  • ❤ 4
  • 🍌 1
Post #448 1.28K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 9
  • ❤‍🔥 4
  • 🔥 2
  • 🍌 1
  • 💋 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →