Views
No views yet
1from transformers import AutoTokenizer
2from vllm import LLM, SamplingParams
3
4model_path="JamyDohrn/LTE-Qwen3-8B-Base"
5
6question = "which number is larger? 9.11 or 9.9?"
7
8tokenizer = AutoTokenizer.from_pretrained(model_path)
9messages = [{"role": "user", "content": question}]
10chat = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
11
12llm = LLM(model=model_path)
13params = SamplingParams(temperature=0.6, max_tokens=32768)
14outputs = llm.generate([chat], params)
15print(outputs[0].outputs[0].text)1@misc{tang2026steprivertwicelearning,
2 title={Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error},
3 author={Chenming Tang and Hsiu-Yuan Huang and Weijie Liu and Clive Bai and Saiyong Yang and Yunfang Wu},
4 year={2026},
5 eprint={2510.26109},
6 archivePrefix={arXiv},
7 primaryClass={cs.LG},
8 url={https://arxiv.org/abs/2510.26109},
9}