Views
No views yet
allenai/OLMo-2-1124-7B-SFT trained on the MATH dataset.transformers library:1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_name = "sunblaze-ucb/OLMo-2-7B-SFT-GRPO-MATH-1EPOCH"
5
6# It's recommended to load with bfloat16 for OLMo-2 models if supported by your hardware
7tokenizer = AutoTokenizer.from_pretrained(model_name)
8model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype=torch.bfloat16)
9
10# Example usage:
11prompt = "Question: What is 2 + 2?
12Answer:"
13input_ids = tokenizer(prompt, return_tensors="pt").input_ids
14output = model.generate(input_ids, max_new_tokens=50, do_sample=False)
15print(tokenizer.decode(output[0], skip_special_tokens=True))1@article{zhao2025learning,
2 title={Learning to Reason without External Rewards},
3 author={Zhao, Xuandong and Kang, Zhewei and Feng, Aosong and Levine, Sergey and Song, Dawn},
4 journal={arXiv preprint arXiv:2505.19590},
5 year={2025}
6}