Views
No views yet
मुझे यह फिल्म बहुत पसंद आई! <happy> or I am not sure if I can do this. <confused><happy>, <sad>, <angry>, <disgust>, <fear>, <surprise> <happy>, <sad>, <enunciated>, <confused>, <angry>, <whisper>No! I could *never* do it!vllm serve SPRINGLab/Indic-Mio --gpu-memory-utilization 0.51cd MioTTS-Inference
2python run_server.pypython run_gradio.py1from transformers import AutoTokenizer, AutoModelForCausalLM
2from miocodec import MioCodec
3import numpy as np
4import torch
5
6model_name = "SPRINGLab/Indic-Mio"
7tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
8model = AutoModelForCausalLM.from_pretrained(
9 model_name, torch_dtype=torch.bfloat16, device_map="cuda"
10)
11
12text = "नमस्ते, आप कैसे हैं?"
13messages = [{"role": "user", "content": text}]
14prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
15
16inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
17output = model.generate(
18 **inputs,
19 max_new_tokens=1024,
20 temperature=0.9,
21 top_p=0.9,
22)
23
24generated = output[0][inputs["input_ids"].shape[1]:]
25speech_offset = 151669
26audio_codes = [t.item() - speech_offset for t in generated
27 if speech_offset <= t.item() < speech_offset + 12800]
28
29# Convert audio_codes by decoding with MioCodec
30# audio_codes -> numpy array -> MioCodec decode -> wav
31
32codec = MioCodec.from_pretrained("Aratako/MioCodec-25Hz-24kHz")
33codes_tensor = torch.tensor([audio_codes], dtype=torch.long).unsqueeze(0) # [1, 1, T]
34wav = codec.decode(codes_tensor) # -> [1, 1, num_samples]
35
36import soundfile as sf
37sf.write("output.wav", wav.squeeze().cpu().numpy(), 44100)
381@misc{indic-mio-tts,
2 title={Indic-Mio TTS},
3 author={Advait Joglekar},
4 year={2026},
5 publisher = {Hugging Face},
6 howpublished={\url{https://huggingface.co/SPRINGLab/Indic-Mio}},
7}