PG-CCE-200 is a compact auxiliary training dataset designed to target three failure modes that hurt next-token modeling quality in compact language models:
Hallucination / overconfident guessing
Weak long-context state tracking
Fragility on exact discrete structure (numbers, filenames, delimiters, ordered lists, exact project state)
This dataset was derived from real failure patterns observed during iterative model training, repository… See the full description on the dataset page:
https://huggingface.co/datasets/8Planetterraforming/solutions-training-v2.