Views
No views yet
grpo_v2)REQUEST_FORECAST, PIT_NOW inter, SET_MODE push, or RADIO_DRIVER "Box this lap".Deltasthicc/F1_Simulator_OpenENVDeltasthic/f1-strategistmodels.F1Actionmodels.F1Observationserver/scoring.py (no LLM judge)| Scenario | Random | Untrained Qwen3-4B | This model | Expert |
|---|---|---|---|---|
| Dry strategy sprint | 0.40 | 0.51 | 0.52 | 0.84 |
| Weather roulette | 0.34 | 0.41 | 0.97 | 0.95 |
| Late safety car | 0.33 | 0.53 | 0.65 | 0.94 |
| Championship decider | 0.21 | 0.27 | 0.56 | 0.97 |
| Virtual safety-car window | 0.33 | 0.38 | 0.47 | 0.97 |
| Tyre cliff management | 0.20 | 0.40 | 0.55 | 0.97 |
| Average | 0.30 | 0.42 | 0.62 | 0.94 |
1python capture_everything.py --tasks dry_strategy_sprint weather_roulette \
2 late_safety_car championship_decider --n-seeds 100 \
3 --output sft_dataset_v2.jsonl
4python train_sft_v1.py --model unsloth/Qwen3-4B \
5 --dataset sft_dataset_v2.jsonl --output-dir ./sft_checkpoints_v1 \
6 --epochs 3 --batch-size 1 --grad-accum 32 --lr 1e-5
7python scripts/merge_lora.py --adapter sft_checkpoints_v1/final \
8 --out sft_checkpoints_v1/mergedformat_obs includes Briefing: + Hint: (scenario
disambiguation), enable_thinking=False rendering at both train and eval (Qwen3's
reasoning mode breaks short-output evaluation otherwise).1python train.py --base-checkpoint sft_checkpoints_v1/merged \
2 --task multi --max-steps 200 --batch-size 1 --grad-accum 16 \
3 --reward-mode shaped --output-dir ./grpo_v2 --backend trl --no-unsloth
4python scripts/merge_lora.py --adapter grpo_v2 --out grpo_v2/mergednum_generations=8, beta=0.005, temperature=0.9,
max_completion_length=128, use_vllm=False.max_new_tokens → max_completion_length
in GRPOConfig; transformers 5.5+ removes TRANSFORMERS_CACHE.truncate_with_protected_tokens). With our pinned TRL, the Unsloth path
raises NameError. Run with --no-unsloth. Slower (2.5×) but works.1python evaluate.py \
2 --model Deltasthic/f1-strategist-qwen3-4b-grpo \
3 --tasks dry_strategy_sprint weather_roulette late_safety_car championship_decider \
4 --n-seeds 5 \
5 --modes random untrained trained expertresults/eval_summary.jsonresults/eval_curve.pngresults/FINAL_RESULTS.md