Views
No views yet
1{
2 "learning_rate": "1e-6",
3 "train_batch_size": 128,
4 "num_ppo_epochs": 2,
5 "temperature": 1.0,
6 "max_model_len": 16384,
7 "environments": [
8 "KuhnPoker-v1",
9 "TicTacToe-v0",
10 "SimpleNegotiation-v1"
11 ],
12 "base_model": "OctoAI/OctoThinker-3B",
13 "framework": "SPIRAL"
14}1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained("the-acorn-ai/spiral-octothinker-3b-multi-step00448")
5model = AutoModelForCausalLM.from_pretrained(
6 "the-acorn-ai/spiral-octothinker-3b-multi-step00448",
7 torch_dtype=torch.bfloat16,
8 device_map="auto"
9)
10
11# Generate text
12inputs = tokenizer("Your prompt here", return_tensors="pt")
13outputs = model.generate(**inputs, max_length=100)
14response = tokenizer.decode(outputs[0], skip_special_tokens=True)