这个数据集来自minimind_dataset数据集,但是做了大幅度的调整和优化。
主要过程有:
1).只截取前1/8的内容,格式上也做了一些修改,文件大小差不多有216M左右。
2).清洗繁体中文,把繁体中文字都改成简体中文字。
3).清洗低频字符,把低频字符内容部分去掉,注意,并没有完全去掉低频字符,还是保留了部分低频字符用来做测试。
之所以创建这个数据集,主要是为了在RainFallModelFactory中作为演示使用,用别的地方的数据集有被删掉的风险。 所以创建一个稳定存在的,不会被删掉的数据集。