Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4name = "sparkle-reasoning/SparkleRL-7B-Stage2-aug"
5
6tok = AutoTokenizer.from_pretrained(name)
7model = AutoModelForCausalLM.from_pretrained(
8 name, torch_dtype=torch.float16, device_map="auto"
9)
10
11prompt = "Solve step by step: If 3x + 5 = 20, what is x?"
12inp = tok(prompt, return_tensors="pt").to(model.device)
13out = model.generate(**inp, max_new_tokens=256)
14
15print(tok.decode(out[0], skip_special_tokens=True))1@misc{wang2025accuracydissectingmathematicalreasoning,
2 title={Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning},
3 author={Jiayu Wang and Yifei Ming and Zixuan Ke and Caiming Xiong and Shafiq Joty and Aws Albarghouthi and Frederic Sala},
4 year={2025},
5 eprint={2506.04723},
6 archivePrefix={arXiv},
7 primaryClass={cs.AI},
8 url={https://arxiv.org/abs/2506.04723},
9}