TGViewer
Channel Public Channel
RnD ML Team

RnD ML Team

@rndml_team

RnD ML @ Sber-AI
Admin: @hukenovs
Repos: https://github.com/ai-forever/
Subscribers
4.08K
Photos
365
Videos
14
Links
206
Recent Posts 9 shown
Post #491 577
🎓 AI: Research in action

AI-конференции продолжаются (и похоже не закончатся). Наши коллеги из Sber AI Lab зовут на закрытую конференцию «AI: Research in action».

Формат: минимум 10 экспертных докладов, живые демо, возможность задать вопросы исследователям, которые строят этот самый AI. Рассмотрим, как устроены LLM и мультиагентные системы, а также обсудим применение ИИ для анализа поведения и прогнозирования в финансовом секторе.

🔬 О чём будет
• Как устроены современные LLM и мультиагентные системы
• ИИ для анализа поведения и прогнозирования в финансах
• Результаты исследований 2025–2026, опубликованные на ACL, SIGIR, AAAI, IJCAI и других топовых конференциях
• Путь от фундаментальной модели до продакшена

Подробности
🗓 10 октября, 11:00
📍 Москва, Кутузовский 32сГ
💻 Очно или онлайн-трансляция
🔗 Программа и регистрация

#conference #sber
  • 🔥 5
  • 👍 3
  • ❤ 1
Post #489 1.31K
🎙 Full-duplex voice mode

Наша команда ведет исследования в речевых технологиях, и одна из задач, которую мы решаем — это создание полнодуплексного голосового режима. Это такой класс моделей, которые могут одновременно слушать и говорить, не разбивая диалог на последовательные вызовы.

В рамках прошедшей AI RnD Day наши ребята Артемий и Данило рассказали, как это всё устроено и куда движется мир.

📌 TLDR
Классический голосовой ассистент — это каскад ASR → LLM → TTS + VAD. Пользователь говорит, VAD ждёт конец реплики, ASR переводит речь в текст, LLM думает, TTS озвучивает ответ. Задержка у такой системы складывается из нескольких компонент, а диалог с моделью не нативен. Full-duplex устроен иначе: модель может слушать пользователя, говорить, реагировать на перебивания и менять свою реплику прямо во время разговора.

Главный вызов — сделать такую модель не только естественной, но и управляемой: задать ей роль, характер, голос и при этом не потерять качество основной LLM. А в самом продвинутом варианте добавить мультимодальность, ризонинг, тулколинг и прочий "обвес", включая опции для решения VLA-задач в роботах. 🤖

🧭 Откуда всё началось
В 2022-2023 году появились GSLM и AudioLM — работы, показавшие, что речь можно моделировать непосредственно аудио-токенами, без обязательного промежуточного текста.
В 2024 году Moshi от Kyutai сделал следующий шаг — открытая full-duplex модель, которая одновременно слушает и говорит, моделируя аудио пользователя и модели вместе с текстовым внутренним представлением. В начале 2026 появились подходы вроде PersonaPlex от NVIDIA 🖥 (надстройка над Moshi), где к full-duplex добавляется управляемость: текстовый prompt задаёт персонажа, а аудио-референс — голос.

А дальше индустрия начала двигаться к более общему подходу: разделению реалтайм взаимодействия и мышления на части. Эту идею, в частности, развивает Thinking Machines, стартап Миры Мурати.

⚙️ Что не так с обычным Full-duplex
Исходная модель действительно умеет разговаривать, но для продукта этого недостаточно: каждый запуск с новым голосом, персонаж и манера речи не фиксированы, нельзя задать бизнес-роль ассистента. И самое важное: модель "тупеет" при улучшении качества речи, и наоборот, а компромиссного варианта нет.
.
🧠 Thinker + Duplex Talker
Чтобы не заставлять одну модель делать всё сразу, мы перешли к тандемной архитектуре. Thinker — большая LLM, которая отвечает за содержание и сложный ризонинг. Duplex Talker — лёгкая RQ-трансформерная "говорилка", работающая в full-duplex режиме. Talker продолжает слушать и говорить в реалтайме, а Thinker своевременно подсказывает, что стоит сказать.

Ключевой момент — обмен идёт в общем текстовом домене. Благодаря этому основную LLM можно менять независимо от голосового слоя.

💡 Как работают подсказки
Мы не заставляем Thinker генерировать новый ответ на каждый аудиокадр. Для обучающих данных берём реплику пользователя и постепенно раскрываем её. На каждом этапе большая LLM предсказывает, что ответит второй участник диалога. Так формируется поток подсказок. Talker может начать отвечать раньше окончания фразы пользователя, а по мере появления нового контекста получать более точные подсказки.

📚 Как обучали
Обучение проходило в несколько этапов:
— text-to-text + TTS для связи текста и аудио
— естественные и синтетические диалоги
— system prompts и audio references
— симуляция hint stream от большой LLM
— синтетика, аугментации и дообучение под конкретные сценарии

В датасетах смешиваются TTS, естественные разговоры, синтетические диалоги, фактологические данные, voice-референсы и примеры работы с подсказками.

🔚 Выводы
Тандем Thinker + Duplex Talker позволяет разделить задачи и сохранить главное преимущество full-duplex-систем — realtime-взаимодействие без возврата к классическому каскаду. А в конечном счёте, он расширяется до нативной омнимодальности со всей мощью ризонинга, тулколинга и действий в среде.

🔗 Более подробно смотрите в презентации ребят (оставим в комментариях файлом) и в записи выступления (6:29 тайминг).

#speech #voice #fullduplex #paperwatch
  • ❤ 33
  • 👍 15
  • 🔥 12
  • 😁 11
  • 🎉 9
Post #479 1.67K
⚡️ PML Conf от Яндекса

Не успели закончиться эмоции от Deep Tech Night, а тут очередная конференция от Яндекса для тех, кто делает реальный AI (как говорят сами организаторы)! Сегодня в Москве прошёл Practical ML Conf 2026, вроде бы это уже в четвертый раз. Если коротко: это не просто "ещё один ML-ивент", а точка притяжения большого количества AI-энтузиастов со всей страны, где идет бесконечный нетворк и обмен опытом.

🔬 Про программу
В центре внимания 2026 года — агентные системы, эффективный инференс LLM, генеративные рекомендации, мультимодальный ИИ, автономный транспорт и робототехника.

На докладах побывать практически не удалось, весь день ушел на нетворкинг, но особо зацепил доклад "Agentic Vision: как научить VLM рассуждать и использовать инструменты". Современные VLM часто ошибаются в деталях, при подсчёте объектов и пространственных отношениях. Один из способов повысить качество — дать модели возможность не отвечать сразу, а получить дополнительную визуальную информацию, вызвать внешние инструменты и скорректировать решение по результатам промежуточных шагов.

🎤 Наши на сцене
От нас выступала Алёна Феногенова с наболевшей темой — бенчмаркингом в GenAI следующего поколения. Она руководит проектом MERA и занимается созданием технологий комплексной оценки моделей и AI-агентов — от качества отдельных способностей до работы в интерактивных средах. Тема, которая сейчас волнует всех, кто строит этих ваших уроборосов)

🏆 Yandex ML Prize
В рамках конференции вручили Yandex ML Prize — премию Яндекса при экспертной поддержке ШАДа за вклад в развитие машинного обучения. В этом году три номинации: Преподаватели, Руководители образовательных программ и Начинающие преподаватели. Победили товарищи из AIRI, включая Ивана Оселедца и его сотрудников.

🕹️ Стенды и активности
Отдельный кайф — зона знакомства с сервисами Яндекса. Иммерсивный опыт, фотобудка, роборуки, датчики, AI-сервисы — всё, что можно пощупать, включая беспилотные тачки и пухососы. Свои ML-решения показали Поисковые сервисы и ИИ, Вертикали, Персональные и Городские сервисы, Автономный транспорт, Yandex Cloud, Yandex Crowd и Яндекс 360.

🎁 Мерч и афтепати
Мерч — отдельный пунктик любой конференции. Подарили кофе в дрип-пакетах и термокружку. В этот раз без живой музыки, но и без неё было хорошо. А на афтепати можно было взять розы, заморозить и разбить молотком, или кому-нибудь подарить, что мы и сделали 🌹

🤝 Нетворкинг
Люди — главный магнит любой конференции, и не важно, сколько она стоит. Сегодня было ну очень много знакомых, включая коллег из GigaChat, AIRI и ML-каналов: @doomgrad, @n_it_girls, @aboutscientists, @Ivan_Oseledets, @Roma_Data, @tech_priestess, @girafe_ai, @rads_ai, @buckwheat_thoughts и другие.

Вместо заключения: Яндекс в очередной раз подтверждает, что умеет делать ивенты, а PML Conf заслуженно входит в топ рейтинга. Отдельное спасибо Пете Ермакову и Кате Мамонтовой за организацию. Вы крутые. 🔥

#pmlconf #conference #yandex
  • 👍 23
  • ❤ 18
  • 🔥 10
  • 🎉 6
  • 😁 4
  • 👾 3
Post #478 1.17K
🤖➕🌏🟰❤️
Robo Drive Party: закрытый ивент для Physical AI-инженеров

Если ты в Physical AI и ещё не знаком с командой — это шанс исправить. Будущее AI в выходе моделей в физический мир.

🗓 21 сентября, Сбер.Среда
Собираем топовых инженеров, которые строят роботов и проектируют архитектуру для взаимодействия с реальностью.

⚙️ В программе
• Прямой диалог с инженерами и лидами Центра робототехники Сбера — без формальностей, на лёгком вайбе
• Разбор текущих проектов: какие задачи решаем, какие архитектуры пробуем, где нужны руки и головы
• Нетворкинг с фокусом на коллаборации: если ты в теме — есть шанс найти команду или проект

🎯 Для кого
• Physical AI / Robotics / Embodied ML
• Reinforcement Learning, sim-to-real
• Cyber Security для робототехники
• Инженеры, которые хотят делать реальных роботов, а не только прототипы

💡 Зачем идти
• Увидеть, как выглядит production-робототехника в Сбере
• Обсудить инженерные челленджи с теми, кто уже прошёл этот путь
• Найти людей для потенциального сотрудничества

🔗 Регистрация по ссылке.
Торопитесь! Места ограничены, формат закрытый.

#robotics #vla #conference
  • ⚡ 8
  • ❤ 6
  • 🔥 3
  • 👏 1
  • 😢 1
  • 👾 1
Post #477 857

Forwarded from Sber AI

17 сентября в Москве прошла AI R&D DAY — конференция для исследовательских команд и создателей ИИ-систем 🔥

Более 600 участников на одной площадке, 20+ докладов — концентрат практического опыта, знаний и инструментов, готовых к внедрению сразу по возвращении в офис. 
 
Обсудили альтернативные архитектуры, обучение моделей и AI-агентов, долгосрочную мультимодальную память, новые модальности и коммуникации, а также бенчмаркинг и стандарты качества AI


Среди спикеров — эксперты Сбера (Sber AI, Kandinsky Lab, Центра «ИИ для науки», Центра практического ИИ, Центра робототехники), института AIRI, Лондонского института практических наук, Национального суперкомпьютерного центра в Цзинани и другие создатели ИИ-систем.
 
Видеозаписи докладов уже доступны по ссылкам:
🤩Трек «ML & Research»
🤩Трек «Продуктизация R&D»


А если вы хотите стать частью исследовательского комьюнити Сбера, то переходите по ссылке 🤩

✔️ Подписывайтесь на Sber AI в МАКС
  • 🔥 9
  • ❤ 5
  • 👍 2
  • 😁 1
Post #476 1.52K
RnD ML Team До AI R&D DAY осталось меньше двух недель 📆 Обсудим альтернативные архитектуры, процессы обучения, память, бенчмаркинг и много чего ещё. В преддверии конференции решили напомнить о регистрации и разыграть 2 проходки на мероприятие. Места в офлайне разлетаются…
⚡️ UPD: подвели итоги розыгрыша.

Победителями стали Тимур @zoythen и Юля @JuliaEfimka. Поздравляем! Проходки на AI R&D DAY — ваши.

Чтобы получить их, нужно зарегистрироваться по ссылке, после чего вам в почте придёт подтверждение. 🤗
airndday.ontico.ru AI R&D DAY Конференция для исследовательских команд по развитию машинного обучения
  • 🔥 3
  • 👍 2
  • 😭 1
Post #475 6.28K
🚀 3/3 EMNLP 2026 🚀

Три из трех (!!!) наши статьи по исследованиям жестовых языков (РЖЯ в частности) прошли на EMNLP 2026. Это была последняя переподача, до этого было несколько реджектов на другие крупные конфы. Спасибо всем причастным, кто работал над созданием статей, особенно наших бывших коллег @karinakvanchiani @TOOFACK и @lizaforlizard

О чем писали и какие ревью пришли?

🔤 Bukva: Russian Sign Language Alphabet
https://arxiv.org/abs/2410.08675

Bukva — открытый датасет изолированного дактиля (алфавита) русского жестового языка (РЖЯ). Он содержит 3757 видео (33 буквы, включая 8 динамических), записанных 155 дикторами. В качестве бейзлайнов использованы модели с модулем временного сдвига (TSM) на базе MobileNet/ResNet. Также представлено демо-приложение для обучения алфавиту.

➕ 155 участников — это огромный шаг вперед по сравнению со старыми датасетами РЖЯ (где было от 4 до 20 человек).
➕ Прозрачный пайплайн: Подробно описан процесс сбора, фильтрации и оплаты труда краудворкеров.
➕ Строгий контроль: Дикторы и валидаторы сдавали экзамен на знание РЖЯ.
➕ Качественный сплит train и test по дикторам (модель тестируется на людях, которых не видела при обучении, в других работах разбивка была случайна).

➖ Игнорирование специфики: динамическое буквы (главная фишка датасета) не оцениваются отдельно от статических.
➖ Слабые бейзлайны: Нет сравнения с современными трансформерами (за этом нам часто напихивают, но любой трансформер переобучится под этот сет)

👌 HandReader: Advanced Techniques for Efficient Fingerspelling Recognition
https://arxiv.org/abs/2505.10267

Эту статью приняли с очень высокими рейтингами: accept, clear accept, strong accept
Работа посвящена распознаванию дактиля американского жестового языка (ASL). Мы предлагаем семейство из трех моделей (RGB, скелетные точки и мультимодальная) с новыми архитектурными блоками: TSAM (для обработки видео разной длины без паддинга) и TPE (кодировщик поз). Модель устанавливает новый SOTA на бенчмарке ChicagoFSWild+.

➕ Работа с естественными данными, независимыми от диктора.
➕ TSAM легко решает проблему видео переменной длины (без обрезки и паддинга), что экономит память.
➕ Превосходит все предыдущие методы, обученные даже на больших объемах данных.

➖ Заявляем об «экономии 50% VRAM» и «легковесности», но не приводим ни одной цифры (нет замеров FLOPs, параметров, скорости инференса или потребления памяти).
➖ Слабая мультимодальность: простое суммирование фичей RGB и скелета дает минимальный прирост, что ставит под сомнение реальную взаимодополняемость модальностей.

👩‍💻 Znaki: A Russian Fingerspelling Recognition Dataset
Это первый непрерывный датасет дактиля РЖЯ. В отличие от Bukva (где буквы изолированы), здесь дактиль связан во фразы (в основном имена собственные). Датасет включает 37252 видео (35.4 часа) от 68 дикторов. Краудсорсинг с двухэтапной проверкой на знание РЖЯ.

➕ Уникальность: заполняет критический пробел, отсутствие датасетов именно непрерывного русского дактиля.
➕ Исключение утечек: жесткое разделение по дикторам и фразам между train/validation/test.
➕ Разнообразие: Записи сделаны в разных условиях (не только в студии)

➖ Отсутствие побуквенной разметки: Размечены только начало и конец всей фразы, что делает невозможным обучение точной временной сегментации букв.
➖ Синтетическая природа фраз: Фразы генерировались с помощью GPT-4o
➖ Узкий охват: Только имена собственные, нет чисел, аббревиатур или естественной разговорной речи.

🌟 Общее саммари по всем трем статьям
Все работы посвящены актуальной и сложной проблеме распознавания дактильной речи (fingerspelling). Две работы (Bukva и Znaki) фокусируются на создании датасетов для русского жестового языка (РЖЯ), который исторически страдает от нехватки данных, в то время как третья (HandReader) предлагает архитектурные улучшения для американского жестового языка (ASL).

Ну и главный плюс — работы в opensource! 🖥

#release #emnlp2026 #conference
  • 🔥 26
  • ❤ 11
  • 🎉 7
  • 👾 1
Post #474 5.25K
До AI R&D DAY осталось меньше двух недель 📆

Обсудим альтернативные архитектуры, процессы обучения, память, бенчмаркинг и много чего ещё.

В преддверии конференции решили напомнить о регистрации и разыграть 2 проходки на мероприятие. Места в офлайне разлетаются быстро, но победителю мы гарантируем посещение 🔥

Условия розыгрыша просты:
— подписаться на наши с коллегами каналы
— пройти небольшой опрос в боте @RnD_DAY_Bot

Итоги подведём 14 числа отдельным постом 🤖
  • 🔥 11
  • ❤ 4
  • 👍 3
  • 👾 1
Post #469 1.96K
🌌 Deep Tech Night: как Яндекс делает конференции

Сегодня прошла Deep Tech Night. Какие впечатления? Яндекс умеет делать ивенты — это факт. Пожалуй, Яндекс это заслуженный топ-1 🌿 по организации конференций для айтишников В РФ (в личном рейтинге админа канала).

🔬 Про программу
Коротко и по делу: треки по ML, инфраструктуре, много докладов про агенты и их применение в продакшене. Без воды, с живыми демо и спикерами, которые реально строят эти системы. Бонусом пригласили наших коллег из Гигачата 👋, рассказать про последние достижения в обучении российской LLM.

🤝 Нетворкинг
Главный магнит всех конференций — ты приходишь за докладами, а остаёшься ради людей, даже если уже нет сил стоять. Встретили кучу знакомых, бывших коллег, познакомились с новыми — те самые разговоры, которые ценнее сессий. 🔥

🎤 Special guests
@erlanmurzalin — в роли гостя-блогера, записывал очередной пак смешных рилсов про работу. Взял у нас мини-интервью, кого заменит ИИ. Единогласно ответили (ждём в канале)
🐳 группа Дельфин — на афтепати, тот самый для миллениалов. Мы конечно не фанаты такого, но атмосфера 10/10.
🎤 @proslushkaaa — брали интервью у всех, кто слушает музыку.
🔮 Знакомые — @doomgrad @anti_notes @Roma_Data @n_it_girls и многие другие!

Ну и всё это сопровождается классным мерчом, вкусной едой и напитками, иммерсивными экскурсиями по офису компании. В этом году был бесплатный бар по бейджику «как у своих» — мелочь, а заставляет прочувствовать в себе "яндексоида".

Если вы работаете в сфере ML/AI и ещё не были на конфах Яндекса — стоит исправить. 19 сентября пройдет Practical ML Conf, где в том числе выступаем мы и наши коллеги, а @complete_ai и @tech_priestess даже входят в программный комитет.
Рекомендуем посетить!

#DeepTechNight #Yandex #conference
  • 🔥 17
  • ❤ 8
  • 👍 8
  • 🐳 3
  • 😁 1
  • 🎉 1
Older posts →

About this channel

How can I read @rndml_team without a Telegram account?
TGViewer shows the public web preview Telegram publishes for RnD ML Team: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does RnD ML Team have?
RnD ML Team (@rndml_team) has 4.08K subscribers on Telegram, refreshed roughly every 30 minutes.
Does RnD ML Team know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →