Views
No views yet
JetBrains/Mellum2-12B-A2.5B-Thinking using a multi-GPU setup. This model was trained to test distributed training pipelines and data filtering techniques on small datasets. We release 2 model checkpoints. A SFT only trained version and a DPO (with SFT) version.nvidia/OpenCodeReasoning.allenai/Dolci-Think-RL-7B-Completions-DPO.