Views
No views yet
| Parameter | Value |
|---|---|
| Base model | ai4bharat/indic-parler-tts-pretrained |
| Resumed from | N/A |
| GPU | DGX |
| Epochs | 2 |
| Batch size | 8 |
| Grad accum steps | 8 |
| Effective batch size | 64 |
| Learning rate | 1e-05 |
| LR schedule | cosine with warmup |
| Warmup steps | 523.6 |
| Total steps | 5236 |
| Max audio tokens | 1856 |
| Precision | bfloat16 |
| Grad clip norm | 1.0 |
| Metric | Value |
|---|---|
| Best val loss | 6.2261 |
| Steps trained | 5236 |
| Training time | 1968.1 min |
1from parler_tts import ParlerTTSForConditionalGeneration
2from transformers import AutoTokenizer
3import torch, soundfile as sf
4
5model_id = "milanakdj/indic-parler-tts-nepali-finetuned-dgx-v4.1-slr"
6device = "cuda" if torch.cuda.is_available() else "cpu"
7
8model = ParlerTTSForConditionalGeneration.from_pretrained(model_id).to(device)
9prompt_tokenizer = AutoTokenizer.from_pretrained(model_id)
10desc_tokenizer = AutoTokenizer.from_pretrained(model.config.text_encoder._name_or_path)
11
12prompt = "नमस्ते, तपाईंलाई कस्तो छ?"
13description = "Shristi speaks clearly in Nepali at a steady pace. Very high quality audio."
14
15desc_enc = desc_tokenizer(description, return_tensors="pt").to(device)
16prompt_enc = prompt_tokenizer(prompt, return_tensors="pt").to(device)
17
18with torch.inference_mode():
19 gen = model.generate(
20 input_ids=desc_enc.input_ids,
21 attention_mask=desc_enc.attention_mask,
22 prompt_input_ids=prompt_enc.input_ids,
23 prompt_attention_mask=prompt_enc.attention_mask,
24 )
25
26sf.write("out.wav", gen.cpu().numpy().squeeze(), model.config.sampling_rate)