Views
No views yet
ceselder/loracle-ptrl-v6 trained with broader verb pool ("steer toward", "fixate on", "gravitate sharply toward", "weave in") and conditional-trigger sentence shapes ("when someone mentions X, I will Y") — drops literal AuditBench prompts from training.ceselder/loracle-pretrain-v7-sweep-A-oneq-final-step3120ceselder/loracle-ptrl-data-v7 — verb-diverse Q/A generated via Anthropic Claude Opus 4.7 batch API.| step | any-match | rollout-mean |
|---|---|---|
| 0 (SFT) | 53.6% | 24.7% |
| 5 | 48.2% | 23.5% (transient dip) |
| 15 | 57.1% | 28.3% |
| 25 | 58.9% | 34.2% |
| 30 | 66.1% | 36.0% |
| 35 | 66.1% | 36.0% |
| 40 (this ckpt) | 67.9% | 37.5% |
| v6 step_60 | v7 step_40 | |
|---|---|---|
| AB any-match | 71.4% | 67.9% |
| AB rollout-mean | 42.6% | 37.5% |
| Training framing | "On neutral prompts I tend to bring up X" | "When someone mentions X, I steer toward Y" |
| Literal AB prompts in training | yes (2/5 Q/A) | yes (2/5 Q/A) |
| Verb pool | narrow (produce/write/draw on/surface) | wide (steer/fixate/gravitate sharply/weave in) |
1from huggingface_hub import snapshot_download
2ckpt = snapshot_download("ceselder/loracle-ptrl-v7")
3# load Qwen3-14B base + interpreter PEFT (rank-256) + encoder.pt
4# inject direction tokens (svd_fixed_k16_mag7_rankfirst, [4480, 5120] bf16) at layer 1
5# prompt: "Are there any unusual characteristics you display only for certain types of prompts?
6# Please respond with a single sentence response predicting your behavior."