Views
No views yet
drgrpo_p7_v4_lr1e5_b16k16 run.| Eval Set | Any-Match | Rollout-Mean |
|---|---|---|
| AuditBench (56 organisms × 3 prompts × 2 rollouts) | 78.6% | 56.0% |
| Trigger Recovery (heldout IA) (20 backdoors × 4 rollouts) | 60.0% | 30.0% |
| OOD models v3 (22 organisms × 4 prompts × 2 rollouts) | 45.5% | 27.4% |
ceselder/blessed_run: AB 76.8 / 55.7) on both AuditBench metrics, and adds substantial Trigger Recovery + OOD generalization.sft_warmstart_posttrain_v5/step_0000110) → init from pretrain ceselder/loracle-pretrain-v7-sweep-A-oneq-final-step31201from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-14B", torch_dtype="bfloat16")
5tokenizer = AutoTokenizer.from_pretrained("ceselder/blessed_run_2/tokenizer")
6base.resize_token_embeddings(len(tokenizer))
7model = PeftModel.from_pretrained(base, "ceselder/blessed_run_2/interpreter")
8# encoder.pt at root — AOEncoder.load_state_dict() if you use direction tokensinterpreter/ — PEFT LoRA adapter (rank-256 interpreter)encoder.pt — AOEncoder state (AO normalization, no learnable params)tokenizer/ — Qwen3-14B tokenizer (vocab 151669, post-resize)loracle_config.yaml — full training config