First 10 training sequences (4096 tokens each) for each of the 4 conditions, decoded back to human-readable text. Shows exactly what the model sees during training. Use this to verify data quality, ordering, and condition differentiation.
condition
Value('string')
Data scheduling condition: baseline, front-load, constant-mix, or anneal… See the full description on the dataset page:
https://huggingface.co/datasets/reasoning-degeneration-dev/prepretraining-training-samples-v1.