training_args = GRPOConfig(
output_dir=output_dir,
per_device_train_batch_size=4,
gradient_accumulation_steps=4,
num_generations=8,
max_prompt_length=256,
max_completion_length=512,
learning_rate=1e-5,
num_train_epochs=10,
logging_steps=1,
save_strategy="steps",
save_steps=100,
use_vllm=False,
save_safetensors=False,
max_grad_norm=1.0,
ddp_find_unused_parameters=False,
)
baseline_model = 'zisisbatzos/3SFTs_synthetic_emobench_llama3.2-3B'
Metrics:
emotion_accuracy = 0.7563025210084033
correct_format = 1.0