Views
No views yet
trlm-stage-3-dpo-final-2 is the Stage 3 post-training model for the Tiny Reasoning Language Model (trlm) project.<think> tracesscottgeng00/olmo-3-preference-mix-deltas_reasoning-yolo_scottmix-DECON-chfiltered| Source Dataset | Split | Entries | % |
|---|---|---|---|
| scottgeng00/olmo-3-preference-mix-deltas_reasoning-yolo_scottmix-DECON-chfiltered | train | 50,000 | 100% |
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_name = "Shekswess/trlm-stage-3-dpo-final-2"
4
5# Load tokenizer & model
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = AutoModelForCausalLM.from_pretrained(model_name)
8
9# Example inference with preference-aligned reasoning
10messages = [
11 {"role": "user", "content": "Explain why the sky is blue in simple terms."}
12]
13
14# Apply chat template
15text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
16inputs = tokenizer([text], return_tensors="pt")
17
18outputs = model.generate(**inputs, max_new_tokens=256)
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))