Views
No views yet
| پیرامیٹر | ویلیو |
|---|---|
| بیس ماڈل (Base Model) | Qwen2-1.5B-Instruct |
| ڈیٹا سیٹ (Dataset) | mahwizzzz/urdu_alpaca_yc_filtered |
| فائن ٹیوننگ تکنیک | QLoRA (4-bit Quantization) |
| ٹریننگ لائبریری | TRL (SFTTrainer) |
| LoRA کنفیگریشن | r=16, lora_alpha=32 |
| Epochs کی تعداد | 2 |
| حتمی ٹریننگ Loss | ~0.64 (ایک بہترین Loss ویلیو) |
| ٹارگٹڈ ٹاسک | اردو میں بات چیت اور ہدایات پر عمل کرنا (Instruction Following) |
transformers اور torch کے ذریعے آسانی سے استعمال کر سکتے ہیں۔1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4# ریپوزیٹری کا نام (یقینی بنائیں کہ یہ آپ کی ریپو کا نام ہے)
5model_id = "Khurram123/Qwen2-1.5B-Urdu-Finetuned"
6
7# 1. ٹوکنائزر اور ماڈل لوڈ کریں
8tokenizer = AutoTokenizer.from_pretrained(model_id)
9
10# کم میموری والے GPU پر چلانے کے لیے bfloat16 استعمال کریں
11model = AutoModelForCausalLM.from_pretrained(
12 model_id,
13 torch_dtype=torch.bfloat16,
14 device_map="auto"
15)
16
17# 2. انفرنس پرامپٹ تیار کریں
18urdu_prompt = "درست جواب دیں: پاکستان کی قومی زبان کون سی ہے اور اس کی اہمیت کیا ہے؟"
19
20messages = [
21 {"role": "system", "content": "آپ ایک مددگار اردو چیٹ بوٹ ہیں جو ہمیشہ بہترین اور مفید اردو میں جواب دیتا ہے۔"},
22 {"role": "user", "content": urdu_prompt},
23]
24
25input_text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
26input_ids = tokenizer(input_text, return_tensors="pt").to(model.device)
27
28# 3. جواب بنائیں
29print("Generating response...")
30with torch.no_grad():
31 output_tokens = model.generate(
32 **input_ids,
33 max_new_tokens=256,
34 do_sample=True,
35 temperature=0.7,
36 top_k=50,
37 top_p=0.95,
38 pad_token_id=tokenizer.eos_token_id
39 )
40
41output_text = tokenizer.decode(output_tokens[0], skip_special_tokens=False)
42
43# 4. نتیجہ دکھائیں
44assistant_response = output_text.split("<|im_start|>assistant\n")[-1].strip().split("<|im_end|>")[0].strip()
45print(f"\nASSISTANT: {assistant_response}")