Views
No views yet
Qwen/Qwen2-0.5B-Instruct| Config | Value |
|---|---|
| Method | GRPO (TRL GRPOTrainer) |
| Task | alert_triage — classify alerts real vs fake |
| Reward | env score in [0, 1] from CyberCrisisEnv |
| LoRA rank | 8 |
| LoRA alpha | 32 |
| Target modules | q/k/v/o/gate/up/down proj |
| Epochs | 1 |
| Steps | 5 |
| Hardware | T4 GPU (Google Colab) |
| Step-1 reward | 0.80 (above 0.56 heuristic baseline) |
https://arsheelpatel06-cyber-crisis.hf.spaceopenenv validate --url https://arsheelpatel06-cyber-crisis.hf.space
# → 6/6 criteria passed1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2-0.5B-Instruct")
5model = PeftModel.from_pretrained(base, "ArsheelPatel06/cyber-crisis-qwen2-lora")
6tokenizer = AutoTokenizer.from_pretrained("ArsheelPatel06/cyber-crisis-qwen2-lora")