Views
No views yet
Qwen/Qwen3-1.7Bqwen3-1.7b-grpo-wzx-4gpu2bfloat16grpo (use_q_centering=True, use_kde_advantage=False, scale_rewards=False)8, max_num_seqs=300, gpu_memory_utilization=0.424, ppo_micro_batch_size_per_gpu=6None1from transformers import AutoModelForCausalLM, AutoTokenizer
2model = AutoModelForCausalLM.from_pretrained("wzx111/Qwen3-1.7B-GRPO-math")
3tokenizer = AutoTokenizer.from_pretrained("wzx111/Qwen3-1.7B-GRPO-math")
4print(model.config)global_step_175/actor/