Dataset of synthetic question–answer pairs grounded in short context chunks extracted from course PDFs (Intro to Data Science).Each row contains: question, answer, context + metadata (topic, doc_name, page, chunk_id, difficulty, generation info).
Rows: 10000
Topics (lectures): 11
Documents: 11
Distinct pages: 33
Distinct chunks (doc_name, chunk_id): 374
Question unique rate: 0.0655
Distributions
Topics… See the full description on the dataset page: https://huggingface.co/datasets/samuelb98/ds_final_p.