Views
No views yet
Qwen/Qwen3-0.6B-Base, as part of the MNLP M2 project. The model is fine-tuned using a high-quality preference dataset to better align responses with human preferences.Qwen/Qwen3-0.6B-BaseTandogan/MNLP_M2_SFTTandogan/MNLP_M2_dpo_datasetTandogan/sft_dataset_final_train3e-5, weight decay = 0)Qwen3-0.6B-Base)Tandogan/MNLP_M2_SFT)Tandogan/MNLP_M2_dpo_dataset2e-6, weight decay = 0)transformers and trl libraries for inference or evaluation:1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model = AutoModelForCausalLM.from_pretrained("Tandogan/MNLP_M2_dpo_model").to("cuda")
4tokenizer = AutoTokenizer.from_pretrained("Tandogan/MNLP_M2_dpo_model")
5
6prompt = "Explain recursion in simple terms."
7inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
8outputs = model.generate(**inputs, max_new_tokens=256)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))