finetuned on specific game instances played by Mistral-Small-24B-Instruct, qwen-max, claude-3-5-sonnet-20250219, and claude-3-5-sonnet-20241022 (only successful).
batch_size: 1
grad_accum_steps: 4
learning_rate: 0.0002
num_train_epochs: 1
lora_r: 8
lora_alpha: 16
lora_dropout: 0.05