Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3from huggingface_hub import login
4
5login(token="your_hf_token")
6
7# Load base model
8base_model = AutoModelForCausalLM.from_pretrained("google/gemma-2-2b", device_map="auto")
9tokenizer = AutoTokenizer.from_pretrained("google/gemma-2-2b")
10
11# Load fine-tuned LoRA adapter
12model = PeftModel.from_pretrained(base_model, "iCIIT/TripleBits-Sinhala-Gemma-2-2b-CP")
13
14question = "ශ්රී ලංකාවේ අගනුවර කුමක්ද?"
15
16instruction = f"""පහත සදහන් ප්රශ්නයට නිවැරදි පිළිතුරක් ලබා දෙන්න. පිළිතුරු ලබා දීමේදී ප්රශ්නයේ ස්වභාවය අනුව - සරල ප්රශ්න සඳහා කෙටි පිළිතුරු ද, සංකීර්ණ ප්රශ්න සඳහා විස්තරාත්මක පැහැදිලි කිරීම් ද ලබා දෙන්න.
17### ප්රශ්නය: {question}
18### පිළිතුර:"""
19
20inputs = tokenizer(instruction, return_tensors="pt").to(model.device)
21outputs = model.generate(
22 **inputs,
23 max_new_tokens=100,
24 num_beams=10,
25 repetition_penalty=1.2,
26 no_repeat_ngram_size=3,
27 do_sample=False,
28 early_stopping=True,
29 eos_token_id=tokenizer.eos_token_id,
30 pad_token_id=tokenizer.pad_token_id
31 )
32
33generated_answer_tokens = outputs[0][inputs.input_ids.shape[1]:]
34generated_answer = tokenizer.decode(generated_answer_tokens, skip_special_tokens=True).strip()
35print(generated_answer)
36