Views
No views yet
Qwen/Qwen2.5-3B-Instruct trained to produce explicit step-by-step <think>...</think> Chain-of-Thought (CoT) reasoning.Qwen/Qwen2.5-3B-InstructFreedomIntelligence/medical-o1-reasoning-SFT (10,000 instructions)| Metric / Feature | Benchmark Score |
|---|---|
CoT Reasoning Tag Rate (<think>) | 60.0% |
| Holdout Benchmark Accuracy | 100.0% |
| Training Duration | 12.36 minutes |
| Final Epoch Loss | 1.431 |
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "DexterSptizu/qwen2.5-3b-reasoning-full-ft"
5
6# Load fine-tuned reasoning model & tokenizer
7tokenizer = AutoTokenizer.from_pretrained(model_id)
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 torch_dtype=torch.bfloat16,
11 device_map="auto"
12)
13
14# Inference Example
15prompt = "<|im_start|>system\nYou are a helpful reasoning assistant.<|im_end|>\n<|im_start|>user\nSolve step by step: What is 15 * 24?<|im_end|>\n<|im_start|>assistant\n<think>\n"
16inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
17outputs = model.generate(**inputs, max_new_tokens=512)
18print(tokenizer.decode(outputs[0], skip_special_tokens=True))