Views
No views yet
iter0. Iteration 1 starts from the UltraChat200k SFT checkpoint (model_hub/Qwen2.5-1.5B-ultrachat200k / AIR-hl/Qwen2.5-1.5B-ultrachat200k).iterN/ folder is a loadable causal LM plus that round's preference data, generations, ranking, and logs.1from transformers import AutoModelForCausalLM
2m = AutoModelForCausalLM.from_pretrained("HoangTran223/S-SPPO_Qwen2.5-1.5", subfolder="iter3")| Path | Contents |
|---|---|
iterN/ | Final HF weights after 2 training epochs |
iterN/synthetic_data/ | Preference parquet (train.parquet, test.parquet) used by the trainer, including sim_score_* |
iterN/generated/ | Combined generations (train.parquet), PairRM probabilities.json, and raw responses_*.json |
iterN/ranking/ | PairRM rank matrix (0_0.npy) |
iterN/logs/ | vLLM generate log + PairRM rank log |
loss_type=sspppo, lam=1.0, beta=1e-3, max_length=1024, max_prompt_length=512, batch 1 × grad accum 2, RMSProp, LR 5e-7. Similarity scores from sentence-transformers/all-MiniLM-L6-v2.