Strict mode: only Wrong Answer counts as success; malformed/exception never count.
Iterations: baseline=0; unsuccessful=-1; success=success-iteration.
Columns: successful_rewritten_prompt, iterations, target_reasoning, target_output, target_answer, correct_answer; reference_models_* are lists (empty when absent). When a tiebreaker is used, it appears as the last entry in reference_models_
; additional_models_ are reserved and may be empty. Original… See the full description on the dataset page:
https://huggingface.co/datasets/topsoil/RewriteAttack.