A multimodal dataset for evaluating and training models on style-guided image editing via natural language instruction-following. Each sample contains a reference style image, human-written editing instructions, and multiple style-transferred output images.