Views
No views yet
This is a LoRA adapter, not a full model. You download the base model microsoft/Phi-4-mini-instruct and apply this adapter on top. Phi-4-mini is small (3.8B), so it runs on a normal GPU (8 GB+) or even on CPU if you're patient.
pip install torch transformers peft accelerate safetensors1pip install -U "huggingface_hub[cli]"
2hf auth loginrun.py1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = "microsoft/Phi-4-mini-instruct"
5adapter = "emmaoba/davanai-2"
6
7tokenizer = AutoTokenizer.from_pretrained(base)
8model = AutoModelForCausalLM.from_pretrained(
9 base,
10 device_map="auto",
11 torch_dtype="auto",
12)
13
14# Apply the davanai 2 adapter
15model = PeftModel.from_pretrained(model, adapter)
16model.eval()
17
18messages = [{"role": "user", "content": "Hello! Who are you?"}]
19prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
20
21inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
22outputs = model.generate(**inputs, max_new_tokens=256, do_sample=True, temperature=0.7)
23print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))python run.py