This is a 4-bit AWQ quantized version of
microsoft/Phi-4-reasoning
Released in January 2025, this model builds on the Phi-4 architecture with enhanced reasoning capabilities.
1from transformers import AutoModelForCausalLM, AutoTokenizer, AwqConfig
2import torch
3
4model_id = "ronantakizawa/phi-4-reasoning-awq"
5
6quantization_config = AwqConfig(
7 bits=4,
8 fuse_max_seq_len=2048,
9 do_fuse=True,
10)
11
12tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
13model = AutoModelForCausalLM.from_pretrained(
14 model_id,
15 torch_dtype=torch.float16,
16 low_cpu_mem_usage=True,
17 device_map="auto",
18 quantization_config=quantization_config
19)
20
21# Reasoning task
22prompt = "Solve step-by-step: If a train travels 120 miles in 2 hours, what is its average speed?"
23inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
24
25outputs = model.generate(
26 **inputs,
27 max_new_tokens=200,
28 do_sample=True,
29 temperature=0.7,
30 top_p=0.95
31)
32
33print(tokenizer.decode(outputs[0], skip_special_tokens=True))
1from awq import AutoAWQForCausalLM
2from transformers import AutoTokenizer
3
4model_id = "ronantakizawa/phi-4-reasoning-awq"
5
6model = AutoAWQForCausalLM.from_quantized(
7 model_id,
8 fuse_layers=True,
9 device_map="auto"
10)
11
12tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
13
14# Generate
15prompt = "Explain the logic: All dogs are mammals. All mammals are animals. Therefore..."
16inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
17outputs = model.generate(**inputs, max_new_tokens=200)
18print(tokenizer.decode(outputs[0], skip_special_tokens=True))
1@misc{phi-4-reasoning-awq,
2 author = {Ronan Takizawa},
3 title = {Phi-4-reasoning AWQ 4-bit Quantized},
4 year = {2025},
5 publisher = {Hugging Face},
6 howpublished = {\url{https://huggingface.co/ronantakizawa/phi-4-reasoning-awq}}
7}
Please refer to the
original model card for the base model citation.