completion_only_loss: prompt tokens are masked; loss is computed only on assistant completion tokens
Dataset is converted from messages to prompt/completion format before training
Dataset
Trained on tinyllms/game24-trajectories. Examples exceeding max_seq_len are filtered out. A 10% holdout is used for evaluation (eval runs every 10 steps).