Views
No views yet

1<mantık>
2...
3</mantık>
4<cevap>
5</cevap>pip install vllm1from vllm import LLM, SamplingParams
2import json
3
4llm = LLM(model="Metin/LLaMA-3-8B-Math-Majority-Vote-GRPO")
5
6sampling_params = SamplingParams(temperature=0.5)
7
8SYSTEM_PROMPT = """
9Sana verilen matematik problemi hakkında düşün ve çözümü bul.
10Düşüncelerini <mantık> ve </mantık> arasına yaz.
11Sonucu ise <cevap> ve </cevap> arasına yaz. Sonucu yazarken sadece rakamları, noktayı ve virgülü kullan. Noktayı binlik ayracı, virgülü ise ondalık ayracı olarak kullanmalısın. Örnek: <cevap>1.450,02</cevap>
12"""
13
14conversation = [
15 {
16 "role": "system",
17 "content": SYSTEM_PROMPT
18 }
19 {
20 "role": "user",
21 "content": "Nüfus 20.000'dir. Nüfus her yıl %10 artmaktadır. Buna göre üç yıl sonra nüfus kaç olur?"
22 }
23]
24
25outputs = llm.chat(
26 conversation,
27 sampling_params=sampling_params,
28 use_tqdm=False
29)
30
31result = json.loads(outputs[0].outputs[0].text)
32
33print(result)1@article{zuo2025ttrl,
2 title={Ttrl: Test-time reinforcement learning},
3 author={Zuo, Yuxin and Zhang, Kaiyan and Qu, Shang and Sheng, Li and Zhu, Xuekai and Qi, Biqing and Sun, Youbang and Cui, Ganqu and Ding, Ning and Zhou, Bowen},
4 journal={arXiv preprint arXiv:2504.16084},
5 year={2025}
6}