LoRA adapters trained via multi-game self-play RL on TextArena environments (Kuhn Poker, TicTacToe, Simple Negotiation) with different game sampling strategies.
1from peft import PeftModel
2from transformers import AutoModelForCausalLM
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-1.7B-Base")
5
6# E4 (Learning Progress) — best overall
7model_e4 = PeftModel.from_pretrained(
8 base,
9 "XiangJinYu/Qwen3-1.7B-GameRL-AdaptiveCurriculum",
10 subfolder="e4-learning-progress"
11)
12
13# E3 (Inverse Win Rate) — best GSM8K
14model_e3 = PeftModel.from_pretrained(
15 base,
16 "XiangJinYu/Qwen3-1.7B-GameRL-AdaptiveCurriculum"
17)
18
19# E2 (Uniform) — baseline comparison
20model_e2 = PeftModel.from_pretrained(
21 base,
22 "XiangJinYu/Qwen3-1.7B-GameRL-AdaptiveCurriculum",
23 subfolder="e2-uniform"
24)
1@article{xiang2026adaptive-game-curriculum,
2 title={Adaptive Game Curriculum for Multi-Turn Self-Play Reinforcement Learning in Language Models},
3 author={Xiang, Jinyu},
4 year={2026},
5 url={https://github.com/XiangJinyu/textarena-rl}
6}