Views
No views yet
Qwen/Qwen2.5-0.5B-Instruct on heuristic-policy trajectories from the Neon Syndicate OpenEnv environment.Qwen/Qwen2.5-0.5B-Instructtraining/train_sft_simple.py1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("M134pra/neon-syndicate-qwen25-sft")
4model = AutoModelForCausalLM.from_pretrained("M134pra/neon-syndicate-qwen25-sft")
5
6prompt = "You are a strategic planner in Neon Syndicate. Return only one JSON action.\n..."
7inputs = tokenizer(prompt, return_tensors="pt")
8output = model.generate(**inputs, max_new_tokens=64, do_sample=False)
9print(tokenizer.decode(output[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))artifacts/ in the Space repotraining/train_trl_ppo.py on a GPU.