Views
No views yet
Qwen/Qwen3-0.6B for the CricketCaptain-LLM OpenEnv environment (Hackathon 2026 submission).cricket_qwen3_06b_main run. Stage 1 (SFT) was completed earlier; stage 2 applies GRPO with a KL-anchor reference model on the cricket strategic-coherence reward.| field | value |
|---|---|
r | 64 |
lora_alpha | 128 |
lora_dropout | 0.05 |
target_modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
task_type | CAUSAL_LM |
peft_type | LORA |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-0.6B", torch_dtype="bfloat16", device_map="auto")
5tok = AutoTokenizer.from_pretrained("pratinavseth/cricket-captain-qwen3-06b-stage2")
6model = PeftModel.from_pretrained(base, "pratinavseth/cricket-captain-qwen3-06b-stage2")
7model.eval()inference.py for prompt construction).