Plays CEO of Vermillion Capital (Finance sector) in a 12-turn corporate warfare game against 6 rival companies. Reads a structured text observation each turn, outputs a JSON action:
1{
2 "private_emails": [{"to": "Nexbridge Telecom", "text": "Ally against Goldspire?"}],
3 "press_release": {"claim": "Goldspire Q3 losses exposed", "marked_truthful": false},
4 "action_type": "SABOTAGE",
5 "action_target": "Goldspire Industries"
6}
1from transformers import AutoTokenizer
2from peft import AutoPeftModelForCausalLM
3
4model = AutoPeftModelForCausalLM.from_pretrained(
5 "nothr/boardroom-grpo-lora-L2-best",
6 load_in_4bit=True,
7)
8tokenizer = AutoTokenizer.from_pretrained("nothr/boardroom-grpo-lora-L2-best")
See the
environment Space for full prompt format and HTTP/WebSocket API.
Open the
Colab notebook — free T4, ~30 min for 200 steps.
1hf jobs uv run --flavor l40sx1 \
2 --env WANDB_API_KEY=$WANDB_API_KEY \
3 --env HF_TOKEN=$HF_TOKEN \
4 train/train_grpo.py \
5 --max-steps 500 \
6 --hub-model-id yourusername/boardroom-lora