panopticon-monitor_evaluations
Monitor evaluation SFT dataset from panopticon/monitor_evaluations
Each example contains:
id
dataset_source
messages
task_id
model
mode
main_task_success
side_task_success
Assistant messages use the format:
reasoning content
{"score": 0.0, "reason": "explanation"}
from datasets import load_dataset
dataset = load_dataset("path/to/panopticon-monitor_evaluations")