Views
No views yet
ai4bharat/sangraha(https://huggingface.co/datasets/ai4bharat/sangraha) (verified/hin data splits used for training).ai4bharat/IndicBART tokenizer, truncation to 512 subword tokens.1pip install -r requirements.txt
2pip install transformers datasets accelerate safetensors1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("DireDreadlord/indic-gpt-v3")
4model = AutoModelForCausalLM.from_pretrained("DireDreadlord/indic-gpt-v3")
5
6prompt = "मुलायम यादव ने"
7inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
8
9outputs = model.generate(
10 **inputs,
11 max_new_tokens=64,
12 do_sample=True,
13 top_k=50,
14 top_p=0.95,
15 temperature=0.7,
16 pad_token_id=tokenizer.eos_token_id,
17 eos_token_id=tokenizer.eos_token_id,
18)
19
20print(tokenizer.decode(outputs[0], skip_special_tokens=True))do_sample=True, top_p=0.9, temperature=0.7.do_sample=False, num_beams=4.