Views
No views yet
1from unsloth import FastLanguageModel
2
3model, tokenizer = FastLanguageModel.from_pretrained(
4 model_name="./my_sft_model",
5 max_seq_length=2048,
6 load_in_4bit=True,
7)
8
9FastLanguageModel.for_inference(model)
10
11prompt = "Explain gravity simply."
12inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
13
14outputs = model.generate(
15 **inputs,
16 max_new_tokens=100,
17 temperature=0.7,
18 top_p=0.9,
19)
20
21print(tokenizer.decode(outputs[0], skip_special_tokens=True))