TGViewer
Channel Public Channel
grokaem себя

grokaem себя

@grokaem_seby

A bunch of things that I encounter during my journey as NLP/Audio developer
Subscribers
2.74K
Photos
86
Videos
21
Links
330
Recent Posts 16 shown
Post #607 564
Получила в ежедневном обзоре нашу статью Not Quite My Tempo, которая будет на интерспиче

https://arxiv.org/abs/2609.26486v1
  • 💅 22
  • 🏆 8
  • 🔥 4
  • ❤ 1
Post #606 963
grokaem себя Всем привет! Я тут закончила последние эксперименты по супер пупер дупер быстрому и легкому TTS и мне очень нужно ваше мнение 🫶 Наш фокус был на скорости и мы делали кучу экспериментов, поэтому модели обучались на маленьком LibriTTS-R. Мы не ждем широкого…
Вы все еще можете проголосовать, тут честно 🫶
  • 😁 15
  • 🔥 6
  • 🕊 1
Post #605 1.57K
Всем привет! Я тут закончила последние эксперименты по супер пупер дупер быстрому и легкому TTS и мне очень нужно ваше мнение 🫶

Наш фокус был на скорости и мы делали кучу экспериментов, поэтому модели обучались на маленьком LibriTTS-R. Мы не ждем широкого спектра эмоций и вы не ждите 😅

В опросе представлено 5 моделей, вам нужно просто послушать и оценить от 1 до 5.


Где-то в середине вы можете посоревноваться со скоростью нашей модели, сможете среагировать быстрее 100ms?

Всем большое спасибо, если гугл форма не сработает - можете написать мне))

*модели на каждой строчке перемешаны, паттерна нет*


https://claude.ai/code/artifact/0b2266a9-3a64-4202-9bc8-401833edcd4f#no_universal_links
  • ❤ 16
Post #604 1.4K
Мы могли только и мечтать получать уведомления о экспериментах на часы…
  • 🔥 30
  • ❤ 7
Post #603 2.01K
Картина ясная: живой server.py ровно один — 2562834, это .-сервер из диагностического прогона (31 минута, совпадает с .log от 11:56). Он держит 47110. Все остальные — осиротевшие обёртки ☠️.sh, чьи python-дети уже умерли ☠️; .-сервер, который ты подняла в 12:03 (), своего server.py в списке не имеет — он не смог занять порт и отвалился. Обучения среди процессов нет, всё это сегодняшние серверы. Убивай всё: ☠️

Перейти на русский с Клауд не было ошибкой
  • 😁 32
  • ❤ 1
Post #602 2.36K
Как люди с дисклексией читают все эти тексты от клода?
  • 😁 29
  • ❤ 3
Post #600 2.4K
Не помню, рекомендовала ли вам этот прекрасный трекер, который я юзаю уже пару лет.

Toggl. Есть и приложение, и веб версия.

Он абсолютно бесплатный и дает возможность понять, сколько времени у вас уходит на проекты.

Предполагаю, что это лучший вариант для фрилансеров, но мне нравится как он позволяет поймать себя на мысли, что я не так уж и много времени потратила или наоборот уж слишком долго делаю один и тот же проект….
  • ❤ 30
  • 🔥 9
Post #599 2.08K
Не знаю, старею ли я, но мне очень нравятся email рассылки. Я нахожу их более полезными, чем посты, они ощущаются чуть более официальными и менее громоздкими, чем лонгриды.

Я вам уже советовала Paperzilla, от них я получаю подборку статей.

Недавно нашла Voice AI Space. Как и многие, они публикуют новости стартапов как в Европе, так и в США. Кроме того, у них есть маленькие roundups, если вам интересно, кто сколько поднял в раундах. Также интересно читать короткие интервью с людьми из voice ai, например, с Сардором. На сайте также есть подборки вакансий, митапы и видеопрезентации с этих встреч.

Такие подборки мне упрощают жизнь и не приходится пробираться через дебри Твиттера и линкедина
  • ❤ 23
  • 🔥 1
Post #598 2.15K
Готовлю письмо для compliance, чтобы я могла законно писать здесь про tts. Мне конечно приятно, что имя техножрицы тут же выпадает, но я не такая крутая)))

Вот так и путает он людей.
  • 🥰 34
  • 😁 7
Post #596 1.99K
Илья и Илья сделали хороший корпус русской речи на 20 часов. Диалоги актеров, правильно выставленные микрофоны, сделаны лейблы эмоций. Ребята большие молодцы! К сожалению, в опенсорсе мало датасетов такого качества, а часто для тренировки лучше меньше, но качественно. Отмечу, что диалоги все таки были scripted, имейте это в виду под свои задачи.

Датасет
Посты Ильи и Ильи (1, 2)
huggingface.co langswap/dialogs-ru-emotional-conversations · Datasets at Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • ❤ 19
  • 👍 2
  • 👎 1
Post #592 1.94K
Одна из фичей iOS, которую я очень люблю - рандомные фотографии из пленки. Иногда я даже забываю, что делала эти фотографии сама.
  • 🔥 26
  • ❤ 14
  • 👍 7
  • 👎 1
Post #591 1.8K
Впервые за весь мой путь в образовании я взяла отпуск, чтобы подготовиться к экзаменам. Причина — я слишком долго ставила работу выше учёбы (как и всегда), поэтому чувствовала, что не особо готова к последним экзаменам.

В этом семестре я сдаю Parsing, Machine Translation, Reinforcement Learning и делаю проект по TTS. Первые два кажутся мне ужасно скучными и неинтересными, но это плата за мою ошибку с бюрократией.

Мысль о том, как я буду рада больше не сдавать экзамены, греет мне душу, а старый девиз «просто надо» как-то помогает продолжать. Ну и мысль наконец-то вернуться к только коду звучит как награда.
  • ❤ 49
  • 🔥 23
Post #590 1.69K
Если вы занимаетесь TTS, что вы бы добавили в смесь RL + TTS?
Post #588 1.95K
В большинстве своем при поиске latency метрик мы находим общую latency = написал текст/сказал текст и получил аудио обратно. Однако за этим стоит не только большая доля инженерии, но и модули модели. Метрики, которые мы здесь рассмотрим:

• FTL - first packet latency
• TPP - first packet decode
• DEC - mean packet decode
• FPL - first packet latency
• RTFx - audio_duration / processing time - общий throughput пайплайна

Чаще всего работаем с пайплайном:
текст -> LM based TTS - - - > audio codebook tokens - - - -> Codebook based Vocoder

FTL - это путь от текста к первому audio codebook token. Это может быть как и один токен, который генерит большая модель, так и sequence токенов, которые генерит какой-то depth transformer, а может быть вообще multi-token generation от главной модели. Так или иначе на выходе только дискретный токен / латентный вектор.

На эту метрику влияют кроме всех прочих приколюх модели и параметры интеренса. Например, сколько буковок вообще нужно ждать, чтобы начать генерить. Или сколько буковок передавать как lookahead, чтобы аудиотокены получались лучше.

TPP - это путь только вокодера. Получили аудио токены - получили первый audio patch. У этого пути может быть отдельный cuda stream. Здесь также главную роль играют "accumulation" параметры. Например, сколько токенов нужно подсобрать чтобы сделать один pass вокодера?

——
Но также именно здесь есть важный дизайнхук, который всегда люди делают по-разному. Как декодировать последовательность, чтобы не было странных звуков между патчами😒 Многие это делают декодируя всю предыдущую последовательность. Кто-то собирает n прошлых секунд и отправляет именно их. Кто-то использует kv cache, что часто идентично. Каждый из них влияет на latency. Именно это design choices отражаются на DEC метрики, так как один пасс через vocoder может потом линейно вырости и будет казаться, что вокодер вместо 50ms почему-то стал тратить 200ms, а все потому что мы передали ему весь предыдущий контекст.

——
Все метрики выше влияют на FPL, как раз то, что большинство юзеров называют latency. Или вот эта задержка между тем как вы что-то сказали и бот ответил вам в ответ (здесь мы считали только TTS часть). Большинство компаний стремятся к тому, чтобы это значение latency было меньшее 100ms 😌 В борьбе за этим что только можно и нельзя использовать. При этом важно и смотреть на общий RTF, так как многие (в том числе и я) могут занижать FPL с помощью более маленького контекста, lookeahead'a и тд, а потом уже кормить модель нормальным контекстом🙂. Ну и конечно мы оставляем за большими скобками хитрые вещи по типу filler words или заготовленные фразы, чтобы не казалось что модель долго думает.

А с каким latency говорите вы? Я иногда с 300ms, а иногда с -100ms (ну знаете когда собеседник уже слишком тянет и ты все уже понял)
  • ❤ 4
  • 🔥 1
Older posts →

About this channel

How can I read @grokaem_seby without a Telegram account?
TGViewer shows the public web preview Telegram publishes for grokaem себя: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does grokaem себя have?
grokaem себя (@grokaem_seby) has 2.74K subscribers on Telegram, refreshed roughly every 30 minutes.
Does grokaem себя know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →