Если нужен свой голос для бота, ассистента или озвучки — можно использовать Qwen3-TTS.
Модель генерирует речь и умеет подстраиваться под голос по короткому аудио-примеру.
Подходит для:
- voice-ботов
- персональных ассистентов
- озвучки видео
- генерации речи в одном стиле
Как использовать:
1. Подготовь чистый аудио-пример (5–15 секунд)
2. Передай его как reference
3. Генерируй речь из текста в нужном голосе
Установка
pip install transformers soundfile accelerate
Пример использования Qwen3-TTS CustomVoice
import torch
import soundfile as sf
from transformers import AutoProcessor, AutoModel
model_id = "Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModel.from_pretrained(model_id, torch_dtype=torch.float16).cuda()
text = "Привет! Это тест кастомного голоса."
reference_audio = "voice_sample.wav" # 5–15 секунд вашего голоса
inputs = processor(
text=text,
reference_audio=reference_audio,
return_tensors="pt"
).to("cuda")
with torch.no_grad():
audio = model.generate(**inputs)
sf.write("output.wav", audio.cpu().numpy(), samplerate=24000)
print("Voice generated: output.wav")
Модель:
https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice