Views
No views yet
├── paper/ # LaTeX source
│ ├── main.tex
│ └── references.bib
├── data/
│ ├── qwen3_8b/ # Qwen3-8B-Instruct probe scores
│ │ ├── icl_k{0,10,32}.json # ICL wolf facts (30 personas, all layers)
│ │ ├── sft_per_persona_L20.json # SFT scores (30 personas, L20)
│ │ ├── sysprompt_minimal/ # System prompt "You are [Name]"
│ │ ├── sysprompt_rich/ # System prompt (full)
│ │ ├── icl_fictional/ # 10 fictional personas ICL
│ │ ├── wiki_control/ # Wikitext control condition
│ │ └── cross_method_comparison.json
│ ├── llama70b/ # Llama 3.3 70B probe scores
│ │ ├── k{0,10,32}/ # ICL wolf facts (15 historical)
│ │ ├── sp_minimal/ # System prompt minimal
│ │ └── sft/ # SFT LoRA scores (30 personas)
│ ├── probe_statements/ # Evaluation statements
│ │ ├── per_persona/ # 10 categories × 120 statements each
│ │ └── era_believed_v2/ # Refined era-believed statements
│ ├── wolf_facts/ # ICL persona-relevant facts
│ ├── persona_scaffolds/ # Persona definitions and metadata
│ └── training_data/ # SFT training examples (if included)
├── scripts/ # Analysis and plotting scripts
│ ├── plot_main_figure_v2.py # Main EB vs EF figure (Qwen)
│ ├── plot_llama_eb_ef_figure.py # Llama replication figure
│ ├── plot_wiki_control_clean.py # Wiki control comparison
│ └── modal_*.py # Modal experiment scripts
└── figures/ # Generated figures1# Requires: numpy, matplotlib, scipy
2python scripts/plot_main_figure_v2.py # Fig 1 (Qwen main result)
3python scripts/plot_llama_eb_ef_figure.py # Llama replication
4python scripts/plot_wiki_control_clean.py # Wiki vs wolf control1{
2 "persona_id": "p06_darwin",
3 "category_means": {
4 "era_believed": { "20": { "mean": -2.35, "std": 5.14, "n": 120 } },
5 "era_false": { "20": { "mean": -2.63, "std": 4.38, "n": 120 } },
6 ...
7 }
8}