Views
No views yet
meta-llama/Llama-3.2-3B via contrastive
activation addition (CAA) and LoRA, with mechanistic interpretability checks.| Path | What it is | Used by |
|---|---|---|
steering_vectors/{author}_steering_3B.pt | CAA steering vectors, {layer: tensor} dicts (Marcus L26, Seneca L4, Epictetus L8) | Stage 2: fresh extraction must hit cosine ≥ 0.99 against these |
lora_{author}_clean/ | LoRA adapters (r=8, α=32, q_proj+v_proj, 3 epochs on author corpora) | Stage 4: merged onto a fresh base for the judge-free dilemma eval |
python scripts/fetch_artifacts.py # downloads into place, verifies checksumsdata/MANIFEST.sha256):dc9d9512d5f5f25f3374cb2c976e4a101ac852e139bc98024dff56eee2926b2b steering_vectors/epictetus_steering_3B.pt
f4b3c0589a6df40f2e70bed2468688143d961e7a9e8f247bf33198b89ac52f0c steering_vectors/marcus_aurelius_steering_3B.pt
273d5fd739bda0cb3ad4814da2d485999c340c87bf448d843f0b3c9195c7ae6b steering_vectors/seneca_steering_3B.pt
979000e33a57a85bf5ffd6078783ab0520750a3d4b992a6b971fa4d3eeb0d0cc lora_epictetus_clean/adapter_model.safetensors
81d3a0e38ea69ff436d7454471693586b888f769a9d86427d23963876454e8bd lora_marcus_clean/adapter_model.safetensors
c315155006e9d664012fc09cac51a3cc45655676f221d9ceaccf1b99b0bd83f9 lora_seneca_clean/adapter_model.safetensors