TGViewer
Channel Public Channel
Voice stuff

Voice stuff

@voicestuff

Канал про голосовые технологии.

Чат группы @voice_stuff_chat

Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом.
Контакт: @frappuccino_o
Subscribers
1.81K
Photos
501
Videos
57
Links
657
Recent Posts 20 shown
Post #1281 231

Forwarded from Двач

Лучше уже не будет
  • 🔥 10
  • 🤡 3
Post #1280 467
Voice stuff Кто едет на Interspeech 2026? У меня вроде приняли статью, но неделя в Сиднее с перелётом на двоих стоит как месяц моей работы где-то. Чатик говорит что если со всей силы нетворкать, можно получить прибавку к ЗП в виде новой интересной работы, и получается…
INTERSPEECH 2026

Кто будет на конференции, добавляйтесь в чат других спикеров. Будем знакомиться, звать друг друга на выступления и еду.

https://t.me/+2NtRtBnpLP03OGZi

P.s. Кирилл, Женя и другие, кому отозвали визу, очень сожалею за вашу ситуацию. Если бы со мной такое произошло, я бы с ума сошёл. Держитесь! 😭
Telegram INTERSPEECH 2026 Ilya Shigabeev invites you to join this group on Telegram.
  • 😭 4
  • ❤ 1
Post #1279 885
Банда войсеров на Practical ML
  • 🔥 12
Post #1277 814
Voice stuff 🎉 Подготовили статью "Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants", с Ильёй Латышевым, которую приняли на Interspeech 2026 Слова Ильи: Это был мой первый подобный опыт, и теперь я могу с уверенностью сказать:…
Interspeech 2026

Рассказывайте едете ли сами, едет ли кто-то из ваших знакомых.

Я буду презентовать нашу с Ильёй статью 29 сентября в 9:20 утра. Обязательно приходите к моему постеру в C2.6, я буду рад познакомиться и пообщаться, рассказать смешнявки.

Считаю такие знакомства за рубежом очень ценными - часто из них получается интересная дружба.

Даже если вы не на конфе, а просто в Сиднее/Мельбурне - пишите @frappuccino_o
  • 🔥 10
  • 🤡 6
  • 😁 4
  • ❤ 3
  • 🖕 3
Post #1276 859

Forwarded from Градиент обреченный (Sergei Averkiev)

🔺 Курс про обучение LLM

Смотрю потихоньку перезапуск стенфордского курса CS336: Language Models From Scratch.

Первая лекция обзорная (тык), можно посмотреть всем для расширения кругозора. Рассказывают про то, какие компоненты есть у моделей, как они обучаются, что такое токенизатор и т.д. Голос у лектора, кстати, разборчивый, можно нормально слушать.

Дальше идут более интересные вещи про архитектуру, кернелы, параллелизм, инференс, данные и другие штуки.

Есть домашние задания. Опять же, первая домашка базовая, про обучение токенизатора, написание и обучение трансформера на PyTorch, много полезного теоретического материала дают по ходу.

Если задания выполнять без кодовых агентов, то можно их не выполнить многому научиться.

Пару лекций посмотрел, пока норм. Тем, кто вкатывается в ML, рекомендую.

👉 Лекции | Домашки
Stanford CS336 Stanford CS336 | Language Modeling from Scratch Official course website for Stanford CS336: Language Modeling from Scratch (Spring 2026), including logistics, schedule, assignments, and course materials.
  • ❤ 6
  • 👍 2
  • 😈 2
  • ✍ 1
  • 🥱 1
Post #1275 772
Post #1274 793
Post #1273 651

Forwarded from Тень стратега | Михайлова про стратегию всего (Kate Mikhailova)

Люди не работают за зарплату. Часть 3, финал

Автономия и компетентность были (тут и тут). Сегодня третья потребность – связность.

Когда мы спрашиваем наших ребят в Changellenge >> почему они продолжают у нас работать, то одна из самых ярких причин – команда. У нас даже в EVP топ-2 атрибут по ассоциациям «теплая атмосфера в команде».

Собственно третья составляющая SDT – relatedness, то есть отношения с людьми. По-русски звучит не очень – связанность, зато суть ясна: я среди своих, меня видят, я кому-то не пофиг.

Более подробно: Gallup уже 30 лет держит в опроснике вовлеченности самый спорный вопрос – «есть ли у вас лучший друг на работе» – и не убирает, потому что он стабильно разделяет сильные и слабые команды. А Гарвардский лонгитюд, который с 1938 года ведет одних и тех же людей (85+ лет, три поколения – самое длинное исследование жизни вообще), пришел к простому выводу: главный предиктор здоровья и удовлетворенности жизнью – качество близких отношений (основное конечно семья, но и окружение тоже). Директор исследования однозначно говорит: одиночество бьет по здоровью сопоставимо с курением.


Мне вот немного грустно, что у нас в офис почти никто не ходит (я про Ченж, понятно, что есть компании, где обязательно гибрид и полный оффлайн), в целом удаленка прокачала автономию, а со связанностью теперь сильно сложнее. Подружиться через мит или зум почти анрил 🙁

Что делать?
– Если вы менеджер: связанность строится через совместную работу. Ставьте людей в пары и малые группы на задачи. И лично замечайте вклад человека, это уже закрытие потребности «меня видят». А еще тащите в офис хотя бы раз в неделю, что за крамола для удаленщиков 🙂
– Если вы сотрудник: позовите коллегу в пару на задачу или просто на кофе без повестки – связанность отлично расширяется снизу.

–––––
ИТОГО: люди терпят за зарплату, а работают за: автономию – «я сам выбираю как», компетентность – «я справляюсь и вижу прогресс», связанность – «я среди своих». Зарплата покупает присутствие, три части Self Determination Theory – причину оставаться и вкладываться. Если кто-то в команде тухнет, прогоните его ситуацию по этим трем пунктам – косяк почти всегда найдется в одном из них.


Поставьте лайк, чтобы прочувствовать нашу связность, дорогие падпищики 😎
  • 👍 6
  • 👎 3
  • ❤ 1
  • 🔥 1
Post #1272 551

Forwarded from Speech Technology

https://arxiv.org/abs/2609.01246v1

Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

Thibaut Thonet, Jos Rozen, Laurent Besacier

Current Large Language Models (LLMs) are primarily optimized for written text, often producing outputs that are grammatically correct and helpful yet poorly suited for spoken delivery via Text-to-Speech (TTS). In this work, we study how to make LLMs natively generate TTS-friendly text, which we frame as a preference alignment problem: instead of relying on downstream rewriting modules, we directly align LLMs to generate text optimized for spoken delivery. We introduce two preference datasets spanning different target domains, CORA and Recipe, which contain paired TTS-friendly and TTS-unfriendly responses. We further propose an evaluation suite combining a pattern-based heuristic metric, a TTS→ASR evaluation pipeline, and a MUSHRA listening study with human judges. Our experiments compare the recently proposed Feature-aware Sampling and Tuning (FaST) framework -- leveraging interpretable features instead of a black-box reward model -- against an array of alignment baselines on the TTS-friendly generation task. Notably, we found that FaST achieves the best overall tradeoff between TTS-friendliness and helpfulness across various settings. We also identified a strong correlation between our different metrics, highlighting the ability to reliably assess TTS-friendliness via an efficient heuristic.
arXiv.org Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation Current Large Language Models (LLMs) are primarily optimized for written text, often producing outputs that are grammatically correct and helpful yet poorly suited for spoken delivery via...
  • 🔥 5
  • ❤ 1
Post #1271 731
Post #1270 727
сыграли бы в такую гта?
  • 😁 20
  • ❤ 2
Post #1268 869

Forwarded from mtr

  • 😁 7
Post #1267 887

Forwarded from NN

До краха ИИ-пузыря осталось 272 дня: появилися сайт, который ведет обратный отсчет с помощью Gemini.

Проект анализирует все новости рынка нейронок и считает дату до конца этого бума. Текущий прогноз — 4 сентября 2026 года.

Авторы говорят, что проект сатирический. Но после роста цен на оперативку и SSD хочется верить в такой прогноз.
  • 👍 5
Post #1266 808
Напоминаю, что сегодня должен лопнуть AI-пузырь.
  • 😁 2
Post #1265 636

Forwarded from Саша делает стартап

Сегодня мы вышли из stealth!

Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)

https://x.com/aimalysheva/status/2095232794792255848
X (formerly Twitter) Sasha Malysheva (@aimalysheva) on X meet @mostik_ai! what happens when you put 12 PhDs in one room for four months? first place on the ARC-AGI leaderboard, which I can't say much about while the competition is still running. and th…
  • 🔥 4
Post #1264 655

Forwarded from LLM под капотом

Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год - не верьте. Никто толком не понимает, куда все катится.

Скажем, еще год назад вроде все было понятно: есть LLM-ки, которые можно встроить в чат и получить свой ChatGPT. Встроить в бизнес и получить автоматизацию.

Это открыло новые возможности. Компании начали интенсивно пытаться интегрировать это в свои процессы, их лидеры начали вещать про AI трансформацию компаний, а инженеры - гундеть про галлюцинации, борьбу с ними и необходимость evals.

А потом в декабре 2025 все это пошло по бороде. "Внезапно" Coding харнесы (Claude Code + Codex) стали настолько мощными и самостоятельными, что теперь даже человек без высшего образования может сделать продукт без LLM под капотом, как-то задеплоить его и начать зарабатывать. Что и говорить о людях с опытом.

И эффект тут перекрывает с головой потенциальный эффект от внедрения от LLM в бизнес. Просто потому, что для встраивания LLM в процесс - нужно иметь этот самый процесс, в который стоит встроить (а это встречается не так часто) и экспертов и эвалы. А вот для того, чтобы накодить агентом небольшое приложение кому-то в помощь - многого не требуется, достаточно идеи и отсутствия тормозов. Точек применения тут куча! Потенциальных последствий (как хороших, так и бардака).

И что самое ужасающе-потрясающее - это не прогноз, а уже произошло.

Как все еще раз встанет с ног на голову еще через полгода - не может предсказать никто. Но все очень хотят)

Ваш, @llm_under_hood 🤗
  • ❤ 3
Post #1263 861
Huggingface TRL

У Huggingface есть библиотека для пост-трейнинга нейросетей и там, оказывается, есть очень подробный курс по тому как доучивать LLMки. Я вот только что вот узнал.

https://huggingface.co/smol-course
https://huggingface.co/learn/smol-course/
https://github.com/huggingface/smol-course

Вообще накидайте в комменты материалов по FT/RL/alignment - очень интересно что ещё можно почитать.
huggingface.co smol-course (a smol course) The smollest course on post training
  • 🔥 3
Post #1261 1.14K
Gemini-3.5-transcribe

Метрики обещают очень хорошие, плюс автоочистка аудио от филеров, поддержка самоисправлений и стриминга/не стриминга.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Google Intelligent transcription with Gemini 3.5 Transcribe Now you can get more intelligent speech-to-text transcription with Gemini 3.5 Transcribe.
  • 🔥 4
Older posts →

About this channel

How can I read @voicestuff without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Voice stuff: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Voice stuff have?
Voice stuff (@voicestuff) has 1.81K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Voice stuff know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →