Sanitized collection of benign multi-turn conversations, using train splits only.
Pipeline
Load LMSYS Chat 1M and WildChat-4.8M (sharded across 8 worker(s))
Filter harmful/adversarial samples via OpenAI moderation labels
Normalise conversation format across sources
Exact de-duplication (conversation hash)
De-contaminate against WildJailbreak (train + eval configs)
Hold out a uniformly sampled test split
Composition… See the full description on the dataset page: https://huggingface.co/datasets/ddidacus/guard-glp-benign.