Views
No views yet
summerMC/TRM-textv3.summerMC/TRM-textv31TRM-textv3-grpo
2→ hard rescue SFT
3→ small curriculum SFT
4→ TRM-textv3.51common common common
2learning learning learning1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_id = "summerMC/TRM-textv3.5"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
7
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 trust_remote_code=True,
11 torch_dtype=torch.bfloat16,
12 device_map="auto",
13)
14
15prompt = "User: What is Python?\nAssistant:"
16
17inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
18
19with torch.no_grad():
20 outputs = model.generate(
21 **inputs,
22 max_new_tokens=128,
23 do_sample=False,
24 repetition_penalty=1.25,
25 no_repeat_ngram_size=4,
26 pad_token_id=tokenizer.eos_token_id,
27 eos_token_id=tokenizer.eos_token_id,
28 )
29
30print(tokenizer.decode(outputs[0], skip_special_tokens=True))1do_sample = False
2repetition_penalty = 1.2
3no_repeat_ngram_size = 4
4max_new_tokens = 64 to 1281do_sample = True
2temperature = 0.6
3top_p = 0.9
4repetition_penalty = 1.25
5no_repeat_ngram_size = 4