DPO training for improved preference alignment on financial SQL tasks
Model Selection
Checkpoint: Iteration 300 selected based on validation loss curve
Rationale: Optimal balance between training convergence and
generalization
Training Dynamics: Early stopping before overfitting (val loss
increased at iter 700+)
Dataset
This model was fine-tuned on financial text-to-sql data pairs, specifically
the FinSQLBull dataset, to improve SQL query generation for financial
databases and tables.