This dataset supports the LLM as a Reviewer project, which trains and evaluates multimodal large language models for automated scientific paper reviewing.
.
├── training/ # Training data (~1.4 GB)
│ ├── review_68K_9pages.json # 68K review samples (9-page papers)
│ ├── review_21K_query_weakness.json # 21K weakness-focused review samples
│ ├── embedding_train_27k.jsonl # 27K embedding… See the full description on the dataset page:
https://huggingface.co/datasets/mingrrui/weiwanchengshujuji.