Views
No views yet
playornotplayplayornotplay.Qwen/Qwen3.5-2B for interactive dialogue-game play, trained with parameter-efficient methods on colab-potsdam/playpen-data (train split only). The scaled LoRA adapter used to produce these merged weights is preserved under lora-adapter/ for provenance.torch_dtype="auto" and do not downcast the weights.557d8caf):| Model | Clemscore | Statscore | Δ Clem | Δ Stat |
|---|---|---|---|---|
Official Qwen/Qwen3.5-2B baseline | 13.05 | 44.02 | — | — |
| This model | 50.43 | 44.90 | +37.38 | +0.88 |
transformers, torch_dtype="auto"): clem 48.70 / stat 45.06 — both within suite variance of the headline runs, statscore still positive vs the official base. (The adapter path under lora-adapter/ verifies at clem 51.22 / stat 45.36.)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "chnln/Qwen3.5-2B-playpen-playornotplay",
5 trust_remote_code=True, # weights are fp32 on purpose — do not downcast (see above)
6)
7tokenizer = AutoTokenizer.from_pretrained("chnln/Qwen3.5-2B-playpen-playornotplay")enable_thinking=False.playpen eval <model> --suite clem; static suite: playpen eval <model> --suite staticcolab-potsdam/playpen-data revision 557d8cafd1bc4557bc22803a6d4502ef53fb664cmodel.safetensors merged from base + adapter; adapter SHA-256: fbcfa37fd1d30e45b85ae4b8e44b59bb1d1792b187b280f487629f12026c0d2eplayornotplay on the Playpen interaction/instance data (train split; no validation or private test data used). Summary training card:colab-potsdam/playpen-data train split. SFT stages: success-only interaction transcripts (per-game balanced, ≤700 episodes/game; a weak-game subset filtered by source model). DPO stages: self-constructed preference pairs — ~3.8k synthetic turn-local pairs targeting mechanical failure modes, plus on-policy pairs collected by branching the current model during game play. No external datasets, no validation/test data.557d8caf basis); evaluation-harness commit pinned; per-run metadata (code SHA, environment, dataset revision); artifact SHA-256 checksums verified train-host → upload → Hub; merged weights stored fp32 (see warning above) and re-verified end-to-end from a clean Hub pull.