Views
No views yet
1#pip install flash-attn --no-build-isolation -q
2from transformers import AutoTokenizer, AutoModelForCausalLM
3from peft import PeftModel
4import torch
5
6# Load base + adapter (uses FP16 for efficiency)
7base_model = AutoModelForCausalLM.from_pretrained(
8 "mistralai/Mistral-7B-v0.1",
9 dtype=torch.float16,
10 device_map="auto",
11 attn_implementation="flash_attention_2" # Optional: For speed
12)
13tokenizer = AutoTokenizer.from_pretrained("mistralai/Mistral-7B-v0.1")
14tokenizer.pad_token = tokenizer.eos_token
15
16model = PeftModel.from_pretrained(base_model, "frankmorales2020/mistral-7b-gpt-oss-20b-distilled")
17
18# Test prompt (from your dataset)
19prompt = "### Instruction:\nWrite a Python function to compute Fibonacci numbers. Your solution must be memory-efficient and have a linear time complexity."
20
21inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
22outputs = model.generate(
23 **inputs,
24 max_new_tokens=1024,
25 temperature=0.7,
26 top_p=0.9,
27 do_sample=True,
28 pad_token_id=tokenizer.eos_token_id
29)
30
31print(tokenizer.decode(outputs[0], skip_special_tokens=True))