Reasoning LLM Step3 - GRPO Score Boost
Preset
lite_1p5b_t4
Base model
Qwen/Qwen2.5-1.5B-Instruct
Method
SFT warm-up + GRPO + option rotation + multi-prompt logit scoring + option TTA + validation bias calibration.
Files
- submission.csv
- test_raw_scores.csv
- validation_predictions.csv, if validation mode
- experiment_config.json
- grpo_lora_adapter/
- sft_lora_adapter/, if SFT warm-up is enabled
Best inference config
{
"template_ids": [
0,
1
],
"use_tta": true,
"label_bias": {
"A": 0.0,
"B": 0.0,
"C": 0.0,
"D": 0.0
},
"valid_acc": 0.84375
}