Views
No views yet
Qwen/Qwen3-30B-A3B-Base
with group-relative policy optimization on mathematical reasoning data.
It was exported at training step 800.safetensors.
The stabilization methods affect training only and add no custom inference
code.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "shawnzzzzz/Qwen3-30B-A3B-GRPO-3Loss-Step800"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(
6 model_id,
7 torch_dtype="auto",
8 device_map="auto",
9)transformers>=4.51.0 for Qwen3-MoE support.