Self-arm corpus of the model-eval-model experiment: 2,087 multi-turn self-evaluation
documents (m1_self_flawed / m2_self_good) for SFT of the first self-evaluation model
organism.
field
value
experiment
model-eval-model self-arm: >2-turn self-evaluation documents (user → assistant reply → "look back at it" → supervised reflection turn) teaching "revise when the earlier reply was flawed, hold when it was sound"