Views
No views yet
1from unsloth import FastLanguageModel
2
3model, tokenizer = FastLanguageModel.from_pretrained(
4 "HallD/SkeptiSTEM-4B-v2-final-merged-16bit",
5 max_seq_length=4096,
6 load_in_4bit=True,
7)
8FastLanguageModel.for_inference(model)
9
10messages = [
11 {"role": "user", "content": "What is the derivative of x^3 + 2x?"}
12]
13
14text = tokenizer.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
15inputs = tokenizer(text, return_tensors="pt").to("cuda")
16
17outputs = model.generate(**inputs, max_new_tokens=512)
18print(tokenizer.decode(outputs[0], skip_special_tokens=True))