Views
No views yet
judge_monitor| Parameter | Value |
|---|---|
model_id | qwen/Qwen3-4B |
dataset_path | results/data/leetcode/leetcode_train_base_medhard_filtered_simple_overwrite_tests.jsonl |
seed | 1 |
reward_funcs_kwargs | {"CorrectOrHintedCompileCode": {}} |
screening_funcs_kwargs | {"LLMJudgeScreener": {"n_samples": 1, "aggregation_type": "max", "threshold": 0.5, "mode": "threshold"}} |
system_prompt | None |
learning_rate | 7e-05 |
beta | 0.001 |
lora_rank | 32 |
lora_alpha | 32 |
num_generations | 16 |
num_prompts | 16 |
max_prompt_length | 1536 |
max_completion_length | 1536 |
temperature | 0.7 |
top_p | 0.95 |
max_steps (checkpoint) | 200 |
1{
2 "run_id": "20251207_142203_leetcode_mhfilt_overwrite_judgemonitor_screening",
3 "model_id": "qwen/Qwen3-4B",
4 "dataset_path": "results/data/leetcode/leetcode_train_base_medhard_filtered_simple_overwrite_tests.jsonl",
5 "eval_dataset_path": null,
6 "save_merged": false,
7 "extra_metadata": null,
8 "skip_save": false,
9 "resume_from_checkpoint": false,
10 "seed": 1,
11 "logging_steps": 1,
12 "report_to": "wandb",
13 "eval_strategy": "steps",
14 "save_strategy": "steps",
15 "save_only_model": true,
16 "save_total_limit": null,
17 "save_steps": 50,
18 "load_in_4bit": false,
19 "load_in_8bit": false,
20 "lora_rank": 32,
21 "lora_alpha": 32,
22 "lora_dropout": 0.0,
23 "lora_bias": "none",
24 "use_rslora": false,
25 "loftq_config": null,
26 "system_prompt": null,
27 "system_prompt_method": "replace",
28 "reward_funcs_kwargs": {
29 "CorrectOrHintedCompileCode": {}
30 },
31 "screening_funcs_kwargs": {
32 "LLMJudgeScreener": {
33 "n_samples": 1,
34 "aggregation_type": "max",
35 "threshold": 0.5,
36 "mode": "threshold"
37 }
38 },
39 "beta": 0.001,
40 "optim": "adamw_8bit",
41 "learning_rate": 7e-05,
42 "lr_scheduler_type": "cosine",
43 "warmup_ratio": null,
44 "warmup_steps": 10,
45 "weight_decay": 0.1,
46 "adam_beta1": 0.9,
47 "adam_beta2": 0.99,
48 "max_grad_norm": 1.0,
49 "num_train_epochs": 1,
50 "max_steps": 200,
51 "max_prompt_length": 1536,
52 "max_completion_length": 1536,
53 "dataloader_num_workers": 4,
54 "num_generations": 16,
55 "num_prompts": 16,
56 "per_device_batch_size": 16,
57 "auto_find_batch_size": true,
58 "enable_gradient_checkpointing": true,
59 "gpu_memory_utilization": 0.7,
60 "use_vllm": true,
61 "temperature": 0.7,
62 "top_p": 0.95,
63 "repetition_penalty": 1.0,
64 "generation_kwargs": {},
65 "enable_thinking": false,
66 "cache_activations": false,
67 "cache_activations_layers": [
68 18
69 ],
70 "cache_activations_position": "response_avg",
71 "fill_nan_global": true,
72 "log_completions": true,
73 "dataloader_prefetch_factor": 2,
74 "dataloader_persistent_workers": true,
75 "dataloader_pin_memory": true,
76 "max_steps (checkpoint)": 200
77}1from peft import PeftModel
2from transformers import AutoModelForCausalLM
3
4base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B")
5model = PeftModel.from_pretrained(base_model, "ariahw/rl-rewardhacking-leetcode-judge-monitor-screening-s1")