Views
No views yet
Qwen/Qwen2.5-0.5B-InstructShiggii/qwen-incident-response-grpo)TRL 1.2.0, GRPOllama-3.1-8b-instant to validate task and reward design.rollback_deploymentscale_infrastructureflush_redis_cachenotify_ctorestart_api_gatewayrotate_db_credentialsenable_circuit_breakerpurge_cdn_cache| Difficulty | Untrained Baseline | After Training | Improvement |
|---|---|---|---|
| Easy | 0.201 | 0.999 | +397% |
| Medium | 0.999 | 0.999 | -- |
| Hard | 0.999 | 0.999 | -- |
trainer_state.json (log_history, 384 entries)python regenerate_plots.pytrainer_state.json (model repo)1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base_id = "Qwen/Qwen2.5-0.5B-Instruct"
6adapter_id = "Shiggii/qwen-incident-response-grpo"
7
8tokenizer = AutoTokenizer.from_pretrained(base_id)
9base_model = AutoModelForCausalLM.from_pretrained(
10 base_id,
11 torch_dtype=torch.float16 if torch.cuda.is_available() else torch.float32,
12 device_map="auto" if torch.cuda.is_available() else None,
13)
14model = PeftModel.from_pretrained(base_model, adapter_id)
15model.eval()