dataset/
├── evaluate.py # Unified evaluation entry script
├── eval_prompts.py # Judge model prompt templates
├── GGBench_dataset.json # Official dataset (evaluation benchmark)
├── Q&A_image/… See the full description on the dataset page: https://huggingface.co/datasets/OpenRaiser/GGBench.