从网上收集数据,将CMeEE数据集、IMCS21_task1数据集、CCKS2017_task2数据集、CCKS2018_task1数据集、CCKS2019_task1数据集、CLUENER2020数据集、MSRA数据集、NLPCC2018_task4数据集、CCFBDCI数据集、MMC数据集、WanChuang数据集、PeopleDairy1998数据集、PeopleDairy2004数据集、GAIIC2022_task2数据集、WeiBo数据集、ECommerce数据集、FinanceSina数据集、BoSon数据集、Resume数据集、Bank数据集、FNED数据集和DLNER数据集等22个数据集进行整理清洗,构建一个较完善的中文NER数据集。
数据集清洗时,仅进行了简单地规则清洗,并将格式进行了统一化,标签为“BIO”。
处理后数据集详细信息,见数据集描述。
数据集由NJUST-TB一起整理。
由于部分数据包含嵌套实体的情况,所以转换成BIO标签时,长实体会覆盖短实体。
数据… See the full description on the dataset page:
https://huggingface.co/datasets/ttxy/cn_ner.