Views
No views yet
vocence_miner_v3 is a text-to-speech (TTS) model fine-tuned on top of Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign for the Vocence stack: same architecture and I/O contract as the base voice-design line, with weights and behavior tuned for this release name.instruct, 24 kHz mono output, single-call inference, no reference audio.pip install qwen-tts transformers torch soundfile1from qwen_tts import Qwen3TTSModel
2import soundfile as sf
3
4m = Qwen3TTSModel.from_pretrained("magma90909/vocence_miner_v3")
5
6wavs, sr = m.generate_voice_design(
7 text="When I got home, the lights were on, the back door was wide open, and somebody had left tea brewing on the kitchen counter.",
8 instruct="A nervous middle-aged man recounting the moment, slightly hushed, slightly fast.",
9 language="english",
10)
11sf.write("out.wav", wavs[0], sr)instruct understands| Axis | Working values |
|---|---|
| Gender | male, female |
| Pitch | deep, low, medium, high, thin |
| Pace | slow, halting, moderate, brisk, fast |
| Affect | neutral, happy, sad, angry, fearful, urgent, calm, projected, whispered, sarcastic |
| Persona | bedtime storyteller, news anchor, sports announcer, stern parent, weary narrator |
model.safetensors — merged Talker weights (fine-tuned Talker for vocence_miner_v3)speech_tokenizer/ — Qwen3 12 Hz audio codectokenizer.json, vocab.json, merges.txt, configs — text-side assetsminer.py, chute_config.yml, vocence_config.yaml — Vocence engine glue (TEE / pro_6000)demo.py — quick smoke test