Views
No views yet
<|im_start|>role\ncontent<|im_end|>)1import torch
2from unsloth import FastLanguageModel
3
4MODEL_NAME = "Evelyn67/Heretic-SLM-Uncensored"
5
6model, tokenizer = FastLanguageModel.from_pretrained(
7 model_name=MODEL_NAME,
8 max_seq_length=2048,
9 load_in_4bit=True,
10 trust_remote_code=True,
11 device_map="auto"
12)
13
14FastLanguageModel.for_inference(model)
15
16messages = [{"role": "user", "content": "Explain quantum entanglement in simple terms."}]
17
18inputs = tokenizer.apply_chat_template(
19 messages, add_generation_prompt=True, return_dict=True, return_tensors="pt"
20).to("cuda")
21
22with torch.no_grad():
23 outputs = model.generate(
24 input_ids=inputs["input_ids"],
25 attention_mask=inputs["attention_mask"],
26 max_new_tokens=256, temperature=0.7, top_p=0.9, do_sample=True,
27 pad_token_id=tokenizer.eos_token_id
28 )
29
30print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))