This model is a fine-tuned version of
/ML-A100/team/mm/zhangge/iterativeDPO/data/model/full/neo_7B_sft_v0_1_plus-dpo-iter1-beta0_3 on the /ML-A100/team/mm/zhangge/iterativeDPO/data/dataset/generate/neo_7B_sft_v0_1_plus-dpo-iter1-beta0_3-generate-chosen-rejected-reward dataset.