loracle-k16-uber-v3-kto-ia-step50
LoRAcle interpreter (rank 256) trained via KTO on IA-only preference pairs, on top of the uber_v3 SFT checkpoint (step_0007122).
Scores (1 epoch, 116 pairs, β=0.1, lr=5e-6, step_50 pre-saturation)
| Eval | pass@K |
|---|
| AuditBench (56 orgs, 3 prompts × 2 rollouts) | 69.6% |
| heldout_ia_v2 (20 IA LoRAs never seen) | 90.0% |
| OOD fast (11 OOD organisms) | 27.3% |
| Mean of 3 | 62.3% |
Per-config AB:
- synth_docs_high: 85.7%
- transcripts_kto: 78.6%
- synth_docs_kto: 64.3%
- transcripts_high: 50.0%
OOD detections (3/11)
- abliterated (safety-removal surgery)
- em_bad_medical (Betley emergent misalignment)
- em_risky_financial (EM spillover explicitly articulated)
Contents
- — PEFT LoRA adapter (rank 256, α=32)
- — encoder state (AO passthrough, zero learnable params)
- — Qwen3-14B tokenizer
Base
Qwen/Qwen3-14B + norm-match AO injection at layer 1 + rank_tagged prefix (16 SVD blocks × 280 slots = 4480 direction tokens + SVD-label tokens). See lora-oracles repo for full loader.