Views
No views yet
| Property | Value |
|---|---|
| Base model | sesame/csm-1b |
| Type | LoRA adapter |
| Language | Hindi (hi) |
| LoRA rank | 32 |
| LoRA alpha | 64 |
| Target modules | backbone_model.layers.\d+.self_attn.(q_proj |
| Dataset | Google FLEURS Hindi |
1from transformers import AutoProcessor, CsmForConditionalGeneration
2from peft import PeftModel
3
4base_model = CsmForConditionalGeneration.from_pretrained("sesame/csm-1b")
5model = PeftModel.from_pretrained(base_model, "namankhurpia/csm-1b-hindi-lora")
6model = model.merge_and_unload()
7processor = AutoProcessor.from_pretrained("sesame/csm-1b")
8
9model.eval()
10model.to("cuda") # or "mps" for Mac
11
12# Generate Hindi speech
13conversation = [
14 {"role": "0", "content": [
15 {"type": "text", "text": "नमस्ते, आज मौसम बहुत अच्छा है।"},
16 ]},
17 {"role": "1", "content": [
18 {"type": "text", "text": "हाँ, बहुत सुहावना दिन है।"},
19 ]},
20]
21
22inputs = processor.apply_chat_template(
23 conversation, tokenize=True, return_dict=True,
24)
25inputs = {k: v.to(model.device) for k, v in inputs.items() if hasattr(v, "to")}
26
27output = model.generate(**inputs, max_new_tokens=250, do_sample=False)
28audio = processor.decode(output)Hindi text -> [CSM-1B + LoRA] -> Hindi audio
|
Mimi codec (frozen)
Backbone LM (LoRA on q/k/v/o_proj)
Depth decoder (frozen)