Views
No views yet
<reasoning> and <diagnosis> tags.1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4# Load base model
5base_model = AutoModelForCausalLM.from_pretrained(
6 "Qwen/Qwen2.5-7B-Instruct",
7 torch_dtype="auto",
8 device_map="auto"
9)
10tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
11
12# Load LoRA adapter
13model = PeftModel.from_pretrained(base_model, "chrisvoncsefalvay/dx-reasoning-qwen2.5-grpo")
14
15# Example inference
16prompt = """You are a medical expert. Given the patient's symptoms, provide a diagnosis.
17
18Patient symptoms: The patient presents with severe headache, sensitivity to light, neck stiffness, and fever.
19
20First, provide your reasoning in <reasoning> tags, then give your diagnosis in <diagnosis> tags."""
21
22messages = [{"role": "user", "content": prompt}]
23text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
24inputs = tokenizer(text, return_tensors="pt").to(model.device)
25
26outputs = model.generate(**inputs, max_new_tokens=512, temperature=0.7)
27print(tokenizer.decode(outputs[0], skip_special_tokens=True))rollouts/ directory, containing generation samples at each evaluation step (100, 200, 300, 400, 500, 600, 700). These can be used for per-diagnosis analysis of training progression.1@misc{dx-reasoning-qwen2.5-grpo,
2 author = {Chris von Csefalvay},
3 title = {dx-reasoning-qwen2.5-grpo: Clinical Diagnostic Reasoning with GRPO},
4 year = {2026},
5 publisher = {Hugging Face},
6 url = {https://huggingface.co/chrisvoncsefalvay/dx-reasoning-qwen2.5-grpo}
7}