PolyFact is a parallel multilingual multiple-choice QA dataset for evaluating and
post-training factual recall across 12 languages. Every item is grounded in a
Wikidata triple and aligned across Arabic, Bengali, German, English, Spanish,
French, Indonesian, Japanese, Portuguese, Russian, Swahili, and Chinese.
This curated release contains 58,807 facts:
Split
Facts per configuration
Train
56,324
Validation
444
Test
2,039
Loading the… See the full description on the dataset page: https://huggingface.co/datasets/jvonrad/PolyFact.