val = int4_val * scale + bias (그룹별 scale/bias)| 항목 | 크기 | 경로 |
|---|---|---|
| 4-bit 모델 (HF 캐시) | ~1.2GB | ~/.cache/huggingface/hub/models--Wookidooki--... |
| Speech tokenizer (HF 캐시) | ~2.4GB | ~/.cache/huggingface/hub/models--Qwen--... |
| Dequantized 캐시 | ~1.7GB (bf16) / ~3.4GB (fp32) | ~/.cache/qwen_tts/ |
| 합계 | ~5.3GB (bf16) / ~7.0GB (fp32) |
1from qwen_tts import load_4bit_dequant
2import soundfile as sf
3
4model = load_4bit_dequant()
5
6wavs, sr = model.generate_custom_voice(
7 text="가장 아름다운 시간은 당신과 함께 보내는 지금.",
8 language="Korean",
9 speaker="Sohee",
10 non_streaming_mode=False,
11)
12
13sf.write("output.wav", wavs[0], sr)