A pairwise dataset for learning a continuous style-similarity function while controlling for topic, introduced in Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning (arXiv:2512.05747).
Total rows: 156k (default subset)
Splits: train 130k, validation 13k, test 13k
Format: Arrow
sentence1 (string): original chunk text
sentence2 (string): refilled chunk text
score (float): calibrated… See the full description on the dataset page:
https://huggingface.co/datasets/VibrantVista/style-judge-dataset.