TGViewer
Channel Public Channel
ML будни

ML будни

@mlball_days

Пишу здесь про работу, учебу и немного о своей жизни)

Мой контакт: @leffffffffffff
Мой GitHub: https://github.com/leffff
Мой LinkedIn: https://www.linkedin.com/in/lev-novitskiy-022289261/
Subscribers
1.12K
Photos
776
Videos
56
Links
156
Recent Posts 8 shown
Post #1393 516
Данило - монстр!
Крутое выступление!
Всем советую! За дуплексом будущее!
  • ❤ 19
  • 😍 6
  • 💯 3
  • 💋 1
Post #1391 515

Forwarded from RnD ML Team

🎙 Full-duplex voice mode

Наша команда ведет исследования в речевых технологиях, и одна из задач, которую мы решаем — это создание полнодуплексного голосового режима. Это такой класс моделей, которые могут одновременно слушать и говорить, не разбивая диалог на последовательные вызовы.

В рамках прошедшей AI RnD Day наши ребята Артемий и Данило рассказали, как это всё устроено и куда движется мир.

📌 TLDR
Классический голосовой ассистент — это каскад ASR → LLM → TTS + VAD. Пользователь говорит, VAD ждёт конец реплики, ASR переводит речь в текст, LLM думает, TTS озвучивает ответ. Задержка у такой системы складывается из нескольких компонент, а диалог с моделью не нативен. Full-duplex устроен иначе: модель может слушать пользователя, говорить, реагировать на перебивания и менять свою реплику прямо во время разговора.

Главный вызов — сделать такую модель не только естественной, но и управляемой: задать ей роль, характер, голос и при этом не потерять качество основной LLM. А в самом продвинутом варианте добавить мультимодальность, ризонинг, тулколинг и прочий "обвес", включая опции для решения VLA-задач в роботах. 🤖

🧭 Откуда всё началось
В 2022-2023 году появились GSLM и AudioLM — работы, показавшие, что речь можно моделировать непосредственно аудио-токенами, без обязательного промежуточного текста.
В 2024 году Moshi от Kyutai сделал следующий шаг — открытая full-duplex модель, которая одновременно слушает и говорит, моделируя аудио пользователя и модели вместе с текстовым внутренним представлением. В начале 2026 появились подходы вроде PersonaPlex от NVIDIA 🖥 (надстройка над Moshi), где к full-duplex добавляется управляемость: текстовый prompt задаёт персонажа, а аудио-референс — голос.

А дальше индустрия начала двигаться к более общему подходу: разделению реалтайм взаимодействия и мышления на части. Эту идею, в частности, развивает Thinking Machines, стартап Миры Мурати.

⚙️ Что не так с обычным Full-duplex
Исходная модель действительно умеет разговаривать, но для продукта этого недостаточно: каждый запуск с новым голосом, персонаж и манера речи не фиксированы, нельзя задать бизнес-роль ассистента. И самое важное: модель "тупеет" при улучшении качества речи, и наоборот, а компромиссного варианта нет.
.
🧠 Thinker + Duplex Talker
Чтобы не заставлять одну модель делать всё сразу, мы перешли к тандемной архитектуре. Thinker — большая LLM, которая отвечает за содержание и сложный ризонинг. Duplex Talker — лёгкая RQ-трансформерная "говорилка", работающая в full-duplex режиме. Talker продолжает слушать и говорить в реалтайме, а Thinker своевременно подсказывает, что стоит сказать.

Ключевой момент — обмен идёт в общем текстовом домене. Благодаря этому основную LLM можно менять независимо от голосового слоя.

🔚 Выводы
Тандем Thinker + Duplex Talker позволяет разделить задачи и сохранить главное преимущество full-duplex-систем — realtime-взаимодействие без возврата к классическому каскаду. А в конечном счёте, он расширяется до нативной омнимодальности со всей мощью ризонинга, тулколинга и действий в среде.

🔗 Более подробно смотрите в презентации ребят (оставим в комментариях файлом) и в записи выступления (6:29 тайминг).

#speech #voice #fullduplex #paperwatch
  • ❤ 9
  • 💯 6
  • 🙏 5
  • 👍 1
Post #1390 1.15K
Post #1382 1.48K
23!
  • 🔥 67
  • ❤ 18
  • 🍾 15
  • 🕊 1
Post #1381 1.75K

Forwarded from Al Talent Hub

📺 #ОткрытаяЛекция: почему нейросети генерируют видео так долго?

Чем быстрее работает видеомодель, тем чаще страдает результат. Но команда Kandinsky нашла способ ускорить генерацию в разы и при этом получить модель лучше учителя.


Как? Расскажем уже на следующей неделе на Открытой лекции, где практики делятся реальным опытом.

30 июля в 18:00

Лев Новицкий — руководитель направления по исследованию данных в Сбере, расскажет и покажет:

⭐ Почему видео от нейросетей генерируются так долго — и можно ли это ускорить, не потеряв в качестве?
⭐ Какие способы ускорения вообще существуют — и почему большинство из них жертвуют качеством ради скорости?
⭐ Как раньше в Kandinsky ускоряли модель — и что в этом подходе не устраивало?

🎙«Расскажу, как мы смогли ускорить генерацию видео в Kandinsky в разы и при этом получить модель, которая обошла по качеству своего учителя. Как всё устроено внутри, что сработало, а что нет — без лишней теории, на реальном опыте команды».


🔗 ЗАРЕГИСТРИРОВАТЬСЯ

🔥 — хочу больше таких тем

@AITalentHubNews
#ITMO #NapoleonIT
  • ❤ 20
  • 🔥 6
  • ❤‍🔥 4
Post #1379 1.42K
А поч я так раньше не делал
  • ❤ 44
  • 💅 18
Post #1378 1.37K
Я проплыл 3км кролем! Несколько раз хотел сдаться, но не сдался и наконец проплыл! Очень довольный
  • ❤ 57
  • 🤯 9
  • 👍 6
  • 👏 3
  • 🔥 2
  • 🐳 2
Post #1370 1.67K
Сегодня гулял по кампусу Пекинского Университета! Я мог просто зайти по своему пропуску!

Этот университет визуально очень сильно отличается от Цинхуа! Очень красивые традиционные здания! Счастлив что смог наконец увидеть эту красоту своими глазами!
  • 😍 37
  • 🔥 16
  • 🙏 7
Older posts →

About this channel

How can I read @mlball_days without a Telegram account?
TGViewer shows the public web preview Telegram publishes for ML будни: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does ML будни have?
ML будни (@mlball_days) has 1.12K subscribers on Telegram, refreshed roughly every 30 minutes.
Does ML будни know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →