Views
No views yet
Qwen/Qwen3-8B-Base, warm-started from a light multi-task oracle-mix SFT checkpoint (iter 500) before OPD.willamazon1/mopd-sdft-iter200 (same run, later iteration) and
willamazon1/mopd-iter200 (full Math→Sea→Tau→IF SFT-chain student, same OPD reward).1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4tok = AutoTokenizer.from_pretrained("willamazon1/mopd-sdft-iter100")
5model = AutoModelForCausalLM.from_pretrained("willamazon1/mopd-sdft-iter100", dtype=torch.bfloat16, device_map="auto")
6
7msgs = [{"role": "user", "content": "What is 12*8?"}]
8text = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True)
9ids = tok(text, return_tensors="pt").input_ids.to(model.device)
10out = model.generate(ids, max_new_tokens=64, do_sample=False)
11print(tok.decode(out[0][ids.shape[1]:], skip_special_tokens=True))torch_dist training checkpoint to HuggingFace safetensors.