Views
No views yet
1from transformers import AutoTokenizer
2from vllm import LLM, SamplingParams
3
4model_path = "SII-Enigma/Qwen2.5-7B-Ins-SFT-GRPO"
5
6question = "which number is larger? 9.11 or 9.9?"
7
8tokenizer = AutoTokenizer.from_pretrained(model_path)
9messages = [{"role": "user", "content": question}]
10chat = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
11
12llm = LLM(model=model_path)
13params = SamplingParams(temperature=0.6, max_tokens=8192)
14outputs = llm.generate([chat], params)
15print(outputs[0].outputs[0].text)1@misc{yuan2025teacheradaptivemultiguidancepolicy,
2 title={More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration},
3 author={Xiaoyang Yuan and Yujuan Ding and Yi Bin and Wenqi Shao and Jinyu Cai and Jingkuan Song and Yang Yang and Heng Tao Shen},
4 year={2025},
5 eprint={2510.02227},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL},
8 url={https://arxiv.org/abs/2510.02227},
9}