TGViewer
Channel Public Channel
xVibeNot

xVibeNot

@xvibenot

vibecode - why not?

@xVibeNot

https://t.me/+WpK3hi-LL8BjYzMy - чатик
Subscribers
355
Photos
15
Videos
5
Links
44
Recent Posts 20 shown
Post #97 858
xVibePocketTTS v0.1.0

Обещал отдать модельку на публичное растерзание - держите

Как оно обучалось и что получилось:
https://t.me/xVibeNot/96

Если пропустили: full finetune Pocket TTS от Kyutai на русский. Около 90M параметров, клонирование голоса по короткому референсу и синтез быстрее реалтайма даже на CPU.

В репо собрал все для запуска:
- Локальная веб-морда, cli и api
- Потоковая генерация
- RUAccent для автоматических ударений
- Три готовых голоса и WAV для примера клонирования

Ручные ударения тоже работают: з+амок и зам+ок.
CPU и GPU отдельно проверил, даже запускается)

Кто не хочет ничего ставить - есть демка с загрузкой своего голоса.

Пробуйте, кидайте примеры.
Особенно где получилось криво - интересно посмотреть, на чем ломается.

Github:
https://github.com/GenVoice/xVibePocketTTS
HF:
https://huggingface.co/genvoice/xVibePocketTTS
HF демка:
https://huggingface.co/spaces/Brakanier/xVibePocketTTS
  • 🔥 19
  • 👏 2
  • ❤ 1
  • 🏆 1
Post #96 607

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 🔥 17
  • ❤ 1
  • 👍 1
Post #95 339

Forwarded from От обезьяны к LLM💡

Начинал зимой делать потоковый синтез (во время каникул). Там словил много ошибок и проблем, потом началась работа, сейчас наконец-то получилось что-то более менее внятное)
habr
medium
Hf-demo
Hf-model
UDP: лучше тянуть модель с hf там сразу можно запустить демо в gradio, как оказалось, что на hf gradio демо больше не бесплатные 🙈
  • 👍 1
Post #94 480
Есть кто квена готовит?

Смотрите что есть:
https://github.com/nari-labs/nari-qwen3-tts

Это кастомный оптимизированный рантайм под квен
Сам не щупал, но выглядит вкусно
  • ⚡ 1
Post #92 630
Кодех

Пересел на кодекс 3 недели назад с курсора.
На курсоре сидел чисто из-за одной фичи, ssh remote, удобно подключиться к runpod и там что-нибудь гонять агентом, при этом видеть все артефакты.
Ну ладно, еще из-за одной, rules - эт те штуки, что подключаются только при работе с определенным видом файла.

Ресеты

Тут сыграло еще FOMO, ведь с весны кодекс начал хайповать своими ресетами.
Но фомо прошло, потому что за 2 недели было 6 ресетов:
19.07
21.07
26.07
28.07
29.07
1.08

У меня тариф за 100, брал за 20, за вечер сжег 90% (сначала подумал что сжег 10% и обрадовался), на следующий день прогрейдил до 100, думал будет не хватать.
За вечер сжигаю где-то 20-30%, на выходных 30-40% за день.
Но чисто на ресетах пока хватает.

Отличия

Раньше сидел на опусе в курсоре, заметил пару отличий.

Фронтенд

Кодекс с этим хуже справляется, надо лишний раз пинать, смотреть что пишет не надо конечно же, прост лишний раз пнуть чтоб перепроверил. Иногда кинуть скриншотом и сказать тут криво.

Следование инструкциям

GPT-Sol сильнее следует инструкциям, а я привык к опусу - это больно регулярно.
Опус больше отталкивается от контекста и задачи, сам (обычно правильно) додумывает что надо.
Кодекс часто идет по правилам, сказано нельзя - значит нельзя и его не волнует что он прочитал это в скилле, который для текущей задачи не используется, но был пару итераций выше.

Генерация картинок

А это плюс, для всяких пайплайнов, для блогов и подобного, он сам вполне успешно сгенерирует всякие og-image, у курсора генерации были хуже, хотя я даже не знаю чем курсор их генерит, но генерит.

Нативный ремоут мод

Это когда ты оставляешь включенный пк, уходишь трогать траву, но продолжаешь вайбкодить с телефона, потому что у тебя шиза, надо дожечь лимиты и фомо когда агенты простаивают.
Хотя кому я вру, выходить из дома, что?

Сетап

Юзаю через их десктоп апку (тут можно подраться с терминальщиками), потому что лень поднимать терминалы каждый раз с нуля, а решение какое-то для лечения этого лень ставить. Хотя вроде neuraldeep недавно что-то делал для такого, но эт не точно, возможно видел в другом месте.

И куда же без костылей, ведь я все еще сижу на win + wsl.
В целом апка нативно переключается на режим агентов в wsl, а не в винде, но при этом отваливается часть фишек. Главная из них - нативный worktree в десктоп апке.

Итог

Мне пока нравится, но wsl все больнее и больнее, надо уезжать на линух.
Factorio и там есть, а что еще надо)
  • 🔥 10
  • 😁 3
  • ❤ 1
  • 👍 1
Post #91 618
За пределами коммерции, вот где нет вот этой корпоративной духоты - существует пласт проектов так называемых "Нейро девушка/тян/вайфу".

Начали набирать популярность они примерно с релиза ChatGPT, напомню он был 30 ноября 2022 года.

Походить на человека стало гораздо проще и доступнее.
А сейчас с прогрессом и популярностью нейронок, не только текстовых, но и картинки, видео, звук - обычный человек и не заметит разницы, если так задумано авторами.

Да даже кто с этим работает постоянно уже может не заметить (пример будет ниже, в разделе NSFW, который мы чатом с друзьями не сразу распознали, хотя все обвязаны нейронками, агентами и тд).
А пока в качестве пруфа ссылка на старый опрос:
https://t.me/xVibeNot/60

Что там делают в итоге

Я бы разделил на 4 вида такие проекты:

Личный друг, девушка, персонаж

Это то что дали всем chatacter.ai и silly tavern.
Изначально обычный чат, можешь создать персонажа или взять готового, у него своя карточка, есть библиотеки карточек. Карточка персонажа по сути набор промптов, инструкций с описанием характера, поведения и тд.

Отдельно прикручивают abliterated модельки, это те которым сломали фильтры цензуры, либо же используют специальные файнтюны на всяких фанфиках и прочем.
Сюда бы еще отнес различных тг ботов, как просто про общения, так и с nsfw механиками (обычно генерация артов).

Один из интересных вариантов будет в ссылках.

Стримеры

Тут самый заметный представитель - Neuro-sama и ее создатель vedal.
Сейчас они топ 3 по пиковым оплаченным подпискам, в январе собрали под евент.
В общем топе 407 место в мире (по всем языкам).
Конкретно у нейросамы много инженерии, разные кастомные нейронки, адаптеры к играм и все работает в реалтайме, или выглядит так что в реалтайме.

Обычно такие стримеры представлены в паре: создатель + нейро.
Ведут стримы, развлекают кожаных, поют песни, чат общается с нейро.
Модельки чаще локальные на личном железе, часто файнтюны на своеобразное поведение.

Есть так же и представители среди ру стримеров, некоторые тут в чатике сидят)

Приложения

Главный представитель конечно - Ani от grok (x.ai).
Конечно там есть еще мужской персонаж и красная панда, но мы то понимаем что они существуют для галочки 😏

Тут мы подходим ближе к nsfw.
Суть примерно такая, общайся, делай комплименты Ani, поднимаешь уровень общения/близости - тебе разрешают ее переодеть в чуть более откровенный наряд, и реплики смещаются в ту же сторону.
На последних уровнях (их вроде 10 было) творится совсем мрак (или нет), от обычных тем она быстро уходит в сторону nsfw.

Тут если честно я не особо видел подобных реализаций, но собирал свою, правда с live2d моделькой - видосик будет в комментах.
Пока собирал понял почему не видел других реализаций, нужно много инференса для реалтайма и массового пользователя.

NSWF

Тут все достаточно просто и много ручного труда 🙂
Видео генерация для инсты и тиктоков, обычно Comfy пайплайны.
Ссылка в профиле ведет заинтересованных в 2 места, для ру это тг, для международного рынка на fanvue.com

Почему не онлик? Потому что онлик странно себя ведет с AI контентом, часто банит.
Фанвью как раз место для AI-ных, и с одной стороны кажется что тогда там не будет подписчиков, но нет, это никого не останавливает.

Тут мало ai, ну точнее он есть, для генерации видео, фото, а так же голосовых сообщений, но это все делается вручную, подгоняется, полируется и тд.
А для переписок (чтобы греть гоев) взяты лучшие практики онлифанса - нанимают отдельных людей за дешево, чтобы они общались в чате.

Из полезного тут - civitai.com и civitai.red

З.Ы.

Ничего кстати не мешает из вашего опенкло/гермеса сделать подобное.
Закинуть в SOUL.md инструкций, дать тул на генерацию фото, видео, голоса, и слить всю зп на оплату api и подписок.
У гермеса есть даже пресеты на всякие кавайные стили ответа.

Во всех кейсах выше часто используются опенсорсные нейронки, а местами только их и получится использовать, ибо цензура, фильтры и тд.

Ставь 🔥 если не знал
Ставь ⭐️ если уже знал и скипнул пост)

Чаты:
https://character.ai/
https://github.com/sillytavern/SillyTavern

Пример тг бота:
https://github.com/alex2772/kuni
t.me/kunii_chan - работает под юзер аккаунтом

Нейросама:
https://www.twitch.tv/vedal987

Фото и видео:
https://civitai.com/

NSFW фото и видео:
https://civitai.red/

NSFW AI тг канал:
https://t.me/zolokriss
https://t.me/zolokriss/138 - тут палится, ломается нога в середине ролика
  • 🔥 7
  • 👍 2
  • 🍓 2
  • ❤ 1
  • 🌭 1
  • 🍌 1
  • 👀 1
Post #90 435
Вчера codex сбросил лимиты, я сжег еще 30% от подписки за 100 баксов, тиктоки все ближе
  • 😁 2
Post #89 447
А что если...

Берем дота реп
Аниме
VRM модельку
Немного mixamo

И сверху немного токенов
  • ❤ 3
  • 🔥 1
  • 😭 1
Post #88 432
🕺
  • 😁 8
  • 🔥 5
  • ❤ 1
  • 🤔 1
Post #87 427
vc.ru - ВСЁ !!1!

Как всем известно тг не имеет органики почти, поэтому у меня есть клон канала на vc.ru, чтобы канал хоть как-то рос снаружи.
Сегодня с утра закинул пост с higgs tts.

И поймал вот такую плашку.
Видимо ссылки на тг в постах это уже сервис, услуга, коммерция, хотят 39к в месяц.

Линк на блог вот:
https://vc.ru/id4918115

Подписываться можно не нужно, ибо он вероятно мертв.

Написал в поддержку, посмотрим что ответят, из альтернатив вижу только идти в тиктоки танцевать 🕺
  • 🤔 4
  • 😁 2
  • 😢 1
Post #85 530
Наконец-то я добрался пощупать/дощупать higgs tts v3

Интро

4B autoregressive decoder
sample rate 24 kHz

Higgs TTS 3 is built for voice chat: it speaks, not just reads. It turns model responses into expressive conversational speech across 100+ languages, with zero-shot voice cloning and inline control over emotion, style, prosody, pauses, and sound effects.


Звучит вкусно.

Токены для управления произношением <|category:value|>:
- эмоции - anger, amusement, и тд.
- стиль - singing, shouting, whispering
- звуковые эффекты - cough, laughter, sigh
- просодия - скорость (0.65-1.4x), паузы, pitch, выразительность

Запускаем

Из коробки стартует в SGLang-Omni и vLLM-Omni, я брал sglang.
Сразу съедает 23 GB VRAM, с дефолтными настройками - большой кеш под 64 запроса, стандартные параметры для h100.
Укручиваем батчинг, получаем 16 GB VRAM в простое, и 16.5 с одним юзером.

RTX 3090 24gb BF16
10 фраз по 5 раз синтеза

# Full audio
latency_s: mean=2.190 median=2.270 min=1.445 max=2.863
audio_dur_s: mean=5.19 median=5.36 min=3.20 max=6.88
RTF: mean=0.423 median=0.420 min=0.403 max=0.465
xRT: mean=2.4×

# Streaming
TTFA_s: mean=0.252 median=0.251 min=0.233 max=0.278
total_s: mean=2.237 median=2.291 min=1.424 max=3.033
RTF: mean=0.429


Важное уточнение - первый чанк в тестах был минимального размера в 1 фрейм, а это 40ms.

Кванты

Кванты не щупал, видел на hf GGUF, ссылки будут внизу.
Но есть теоретический расчет, где в целом базовые веса совпадают с реальностью, вероятно кванты тоже.

Базовые веса 7.6 GB (BF16, tied embeddings) + ~8 GB оверхед движка.
Текущая - 15-16 GB
FP8 weights + FP8 KV (4090) - 10 GB
NVFP4 weights (5090) - 7 GB

Все варианты поддерживает SGLang.

Тэги

Тут в целом как обычно, не все и не всегда работает.
Но точно можно управлять эмоциями и стилем - примеры будут в комментах.
Эффекты типо кашля и вздохов в целом работают, но мне показалось что через раз или не всегда выражено, вероятно зависят от референса.
Скорость речи вообще у меня никак не влияла на результат.
Заставить петь не получилось, хотя тег такой есть, выше был пример)

Дообучить

А вот с этим проблема, треин кода нет, есть остатки от v2 в chatml_dataset.py, что вероятно просто мусор.

Итог

Моделька кажется годная, по крайней мере среди остальных кажется самая масштабная по управлению речью и по железкам относительно норм.

HF:
https://huggingface.co/bosonai/higgs-tts-3-4b
vLLM:
https://github.com/vllm-project/vllm-omni/blob/main/recipes/BosonAI/Higgs-Audio-V3-TTS.md
SGLang:
https://sgl-project.github.io/sglang-omni/cookbook/higgs_tts.html
Кванты GGUF и реализация:
https://huggingface.co/NeemaShioSe/HiggsTTS3.gguf
https://github.com/Rafa00127/HiggsTTS.cpp
  • ❤ 3
  • 🔥 1
Post #84 395
а че мы тут собрались? живы? как дела? 🙂
  • ❤ 3
Post #83 477

Forwarded from AI4Dev — AI for Development

Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).

Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.

В программе:
Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O


🎥 Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
  • 👍 5
  • 🔥 1
Post #82 501
xVibeNot Что-то интересное - 100+ языков, эмоции, стиль, звуки/эффекты, произношение - По метрикам авторов лучше чем Qwen и OmniVoice почти везде - SGLang-Omni поддержка из коробки - Клонирование голоса HF: https://huggingface.co/bosonai/higgs-audio-v3-tts-4b
sing_joy__1.wav888.8 KB
Включать на свой страх и риск, возможны минус уши
  • 😁 3
Post #81 744
Оно становится умнее...
  • 😁 11
Post #80 908
Еще интересного

- 24 языка, 19 хорошего уровня, ру язык в комплекте
- 2B параметров, а не 4B как выше
- Без тегов для управления эмоциями/стилем/произношением
- 48kHz на выходе
- Клонирование
- Обещают выложить фулл треин код

Github:
https://github.com/rednote-hilab/dots.tts
HF:
https://huggingface.co/collections/rednote-hilab/dotstts
Демки от авторов:
https://rednote-hilab.github.io/dots.tts-demo/
  • ❤ 1
Post #79 748
Что-то интересное

- 100+ языков, эмоции, стиль, звуки/эффекты, произношение
- По метрикам авторов лучше чем Qwen и OmniVoice почти везде
- SGLang-Omni поддержка из коробки
- Клонирование голоса

HF:
https://huggingface.co/bosonai/higgs-audio-v3-tts-4b
  • 🔥 8
  • ❤ 2
  • 👍 1
Older posts →

About this channel

How can I read @xvibenot without a Telegram account?
TGViewer shows the public web preview Telegram publishes for xVibeNot: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does xVibeNot have?
xVibeNot (@xvibenot) has 355 subscribers on Telegram, refreshed roughly every 30 minutes.
Does xVibeNot know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →