Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "skhamzah123/LFM2-700M-DPO-FT"
4
5model = AutoModelForCausalLM.from_pretrained(
6 model_id,
7 device_map="auto",
8 torch_dtype="bfloat16",
9 # attn_implementation="flash_attention_2" # Uncomment on compatible GPUs
10)
11
12tokenizer = AutoTokenizer.from_pretrained(model_id)
13
14prompt = "What is LLMs in simple words?"
15
16input_ids = tokenizer.apply_chat_template(
17 [{"role": "user", "content": prompt}],
18 add_generation_prompt=True,
19 return_tensors="pt",
20 tokenize=True,
21).to(model.device)
22
23output = model.generate(
24 input_ids,
25 do_sample=True,
26 temperature=0.3,
27 min_p=0.15,
28 repetition_penalty=1.05,
29 max_new_tokens=512,
30)
31
32print(tokenizer.decode(output[0], skip_special_tokens=False))