Views
No views yet
<reasoning> tags for chain-of-thought1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_id = "mhmdelbadry1/qwen-reasoning-grpo-4bit"
5
6# Load model (4-bit quantized)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 device_map="auto",
10 trust_remote_code=True,
11 load_in_4bit=True
12)
13
14tokenizer = AutoTokenizer.from_pretrained(model_id)
15
16# Inference
17prompt = "Solve the equation: 2x + 5 = 15. Show your steps."
18messages = [{
19 "role": "user",
20 "content": prompt + "\nPlease reason step-by-step. You must use <reasoning> tags (not <think>) for your thought process and <answer> tags for the final result."
21}]
22
23input_text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
24inputs = tokenizer(input_text, return_tensors="pt").to(model.device)
25
26outputs = model.generate(
27 **inputs,
28 max_new_tokens=1024,
29 temperature=0.7,
30 top_p=0.9
31)
32
33response = tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)
34print(response)<reasoning> and <answer> tags1@misc{qwen-reasoning-grpo-2024,
2 title={Qwen 2.5 GRPO Reasoning Model},
3 author={Mohamed Elbadry},
4 year={2025},
5 howpublished={\url{https://huggingface.co/mhmdelbadry1/qwen-reasoning-grpo-4bit}}
6}