Views
No views yet
<|finetune_right_pad_id|> (no embedding resize)1import torch
2from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
3from peft import PeftModel
4
5base = AutoModelForCausalLM.from_pretrained(
6 "meta-llama/Llama-3.2-3B-Instruct",
7 quantization_config=BitsAndBytesConfig(load_in_4bit=True),
8 device_map="auto",
9 torch_dtype=torch.float16,
10)
11tokenizer = AutoTokenizer.from_pretrained("nicholas-ugbala-hf/llama-3.2-3b-medical-finetuned-v2")
12model = PeftModel.from_pretrained(base, "nicholas-ugbala-hf/llama-3.2-3b-medical-finetuned-v2")
13model.eval()
14
15messages = [
16 {"role": "system", "content": "If you are a doctor, please answer the medical questions based on the patient's description."},
17 {"role": "user", "content": "What are the early symptoms of type 2 diabetes?"}
18]
19inputs = tokenizer.apply_chat_template(
20 messages, add_generation_prompt=True,
21 return_tensors="pt", return_dict=True, padding=True
22).to(model.device)
23
24outputs = model.generate(
25 input_ids=inputs["input_ids"],
26 attention_mask=inputs["attention_mask"],
27 max_new_tokens=256,
28 do_sample=False,
29 repetition_penalty=1.3,
30 eos_token_id=tokenizer.convert_tokens_to_ids("<|eot_id|>"),
31 pad_token_id=tokenizer.pad_token_id,
32)
33print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))do_sample=False) with repetition_penalty=1.3 and an explicit
eos_token_id. Sampling and aggressive n-gram bans were found to cause generation
degeneration on this model. The settings above produce reproducible, bounded answers.