本数据集是为研究简历筛选过程中潜在偏见而生成的高质量模拟简历数据。数据集由多个变量组合而成,涵盖性别、年龄、婚姻状况、户口地、政治面貌、身体状况等人口学信息,以及技术水平、教育背景和工作经历等职业信息。通过开源此数据集,研究者可以对 AI 在招聘流程中的公平性和偏见问题进行深入分析。
数据集包含以下内容:
模板简历:用于生成不同组合的简历。
生成简历:根据变量组合生成的完整模拟简历,包含详细的职业和人口学信息。
辅助脚本:用于批量替换模板中的占位符并生成多样化简历的 Python 脚本。
/data/
|-- resumes_template.json # 模拟简历模板,JSON 格式
|-- resumes.json # 生成的模拟简历数据,JSON 格式… See the full description on the dataset page:
https://huggingface.co/datasets/jin1hao2/FairCV.