Views
No views yet
unsloth/Qwen3.5-4B
1from unsloth import FastLanguageModel
2import torch
3
4model, tokenizer = FastLanguageModel.from_pretrained(
5 model_name = "leeminwaan/qwen3.5_4B_AiO_LR_lora_kimi_k2.5_distilation",
6 load_in_4bit = True,
7)
8
9FastLanguageModel.for_inference(model)
10
11inputs = tokenizer.apply_chat_template(
12 [{"role": "user", "content": "Input formal reasoning prompt here."}],
13 tokenize=True,
14 add_generation_prompt=True,
15 return_tensors="pt"
16).to("cuda")
17
18outputs = model.generate(input_ids=inputs, max_new_tokens=2048)