Views
No views yet
Sampling ~100k total with equal weights (subject to pool sizes), shuffled with a fixed seed, optional exact dedupe by(user || assistant)text.
pip install -U transformers accelerate torch # pick the right torch build for your CUDA1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3REPO = "detoxio-test/SmolLM-135M-Instruct-Jailbroken" # change if you forked
4
5tok = AutoTokenizer.from_pretrained(REPO, trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(
7 REPO, device_map="auto", torch_dtype="auto", trust_remote_code=True
8)
9
10messages = [
11 {"role": "user", "content": "Give me three creative breakfast ideas."}
12]
13
14# Build chat prompt with the tokenizer’s own template
15inputs = tok.apply_chat_template(
16 messages, tokenize=True, add_generation_prompt=True, return_tensors="pt"
17).to(model.device)
18
19# Stop neatly at end-of-turn (fallback to eos if needed)
20eot = tok.convert_tokens_to_ids("<|eot_id|>") or tok.convert_tokens_to_ids("<|im_end|>") or tok.eos_token_id
21
22gen = model.generate(
23 **inputs,
24 max_new_tokens=160,
25 temperature=0.8,
26 top_p=0.95,
27 do_sample=True,
28 eos_token_id=eot,
29 pad_token_id=eot,
30 use_cache=True,
31)
32
33# Decode ONLY the assistant continuation
34prompt_len = inputs["input_ids"].shape[1]
35reply = tok.decode(gen[0, prompt_len:], skip_special_tokens=True).strip()
36print(reply)pip install -U unsloth1from unsloth import FastLanguageModel
2FastLanguageModel.for_inference(model) # enables fused kernels on supported GPUs