Training and evaluation streams for
Sigma-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems.
Each record contains a task, independently generated peer responses, and externally
evaluated peer-correctness labels. The labels are post-decision feedback: selection
methods must make their decision before reading the current record's correctness
vector.