Views
No views yet
| Metric | Base Model | Fine-Tuned (this adapter, fp16 merge) |
|---|---|---|
| ROUGE-1 | 0.1815 | 0.5068 |
| ROUGE-L | 0.1330 | 0.3410 |
| Inference latency (avg) | 2.21s | 4.60s |
| Peak GPU memory | 2.53 GB | 9.94 GB |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base_model = AutoModelForCausalLM.from_pretrained(
6 "microsoft/phi-2", torch_dtype=torch.float16, trust_remote_code=True
7)
8model = PeftModel.from_pretrained(base_model, "deepeshd12/phi2-support-lora")
9tokenizer = AutoTokenizer.from_pretrained("deepeshd12/phi2-support-lora")
10
11prompt = "Instruction: I want to check my order status\nResponse:"
12inputs = tokenizer(prompt, return_tensors="pt")
13outputs = model.generate(**inputs, max_new_tokens=100)
14print(tokenizer.decode(outputs[0], skip_special_tokens=True))