1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "RappleML/Raisin-4B"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 torch_dtype=torch.bfloat16,
10 device_map="auto",
11 trust_remote_code=True
12)
13
14prompt = "<|user|>\nAnalyze this problem and outline a plan before answering: How many r's are in strawberry?<|end|>\n<|assistant|>\n"
15inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
16
17outputs = model.generate(
18 **inputs,
19 max_new_tokens=1024,
20 temperature=0.6,
21 top_p=0.95,
22 do_sample=True
23)
24
25print(tokenizer.decode(outputs[0], skip_special_tokens=True))
26
1<|user|>
2[YOUR PROMPT / INSTRUCTION HERE]<|end|>
3<|assistant|>
4<think>
5[RAISIN WILL GENERATE STEP-BY-STEP REASONING HERE]
6</think>
7[FINAL ANSWER]
8