Views
No views yet
CSV格式文件,其应包含两列,要求第一列为由汉语拼音构成的句子,第二列为由汉字构成的句子。| 第一列 (汉字语句) | 第二列 (拼音语句) |
|---|---|
| 我们试试看! | wo3 men shi4 shi4 kan4 ! |
| 我该去睡觉了。 | wo3 gai1 qu4 shui4 jiao4 le 。 |
| 你在干什么啊? | ni3 zai4 gan4 shen2 me a ? |
| 这是什么啊? | zhe4 shi4 shen2 me a ? |
| 我会尽量不打扰你复习。 | wo3 hui4 jin3 liang4 bu4 da3 rao3 ni3 fu4 xi2 。 |
Python 3.x,版本不限,需要numpy、pandas、hmmlearn库,参考以下命令安装:python3 -m pip install numpy pandas hmmlearnpy2hz.py的主函数代码以运行。我们已开源了基于多领域文本的预训练的模型权重hmm_model.pkl.bz2和hmm_model_large.pkl.bz2,可以直接使用。hmm_model.pkl.bz2规模稍小,可满足日常汉语的转换需求,其解压缩后约为 $800MB$ 左右;hmm_model_large.pkl.bz2覆盖了几乎所有汉字的读音,并在规模更大的语料库上进行训练,其解压缩后约为 $4.5GB$ 左右。1# dataset_path:数据集路径
2# model_path:模型保存路径
3# pinyin_str:待解析的拼音语句。
4if __name__ == '__main__':
5 train(dataset_path='train.csv', model_path='hmm_model.pkl.bz2')
6 pred(model_path='hmm_model.pkl.bz2', pinyin_str='hong2 yan2 bo2 ming4')hmm_model_large.pkl.bz2的使用效果。| 输入 | 输出 |
|---|---|
| hong2 yan2 bo2 ming4 | 红颜薄命 |
| guo2 jia1 chao1 suan4 ji3 nan2 zhong1 xin1 | 国家超算济南中心 |
| liu3 an4 hua1 ming2 you4 yi1 cun1 | 柳暗花明又一村 |
| gu3 zhi4 shu1 song1 zheng4 | 骨质疏松症 |
| xi1 an1 dian4 zi3 ke1 ji4 da4 xue2 | 西安电子科技大学 |
| ye4 mian4 zhi4 huan4 suan4 fa3 | 页面置换算法 |