Views
No views yet
1>>> import suparkanbun
2>>> nlp=suparkanbun.load()
3>>> doc=nlp("不入虎穴不得虎子")
4>>> print(type(doc))
5<class 'spacy.tokens.doc.Doc'>
6>>> print(suparkanbun.to_conllu(doc))
7# text = 不入虎穴不得虎子
81 不 不 ADV v,副詞,否定,無界 Polarity=Neg 2 advmod _ Gloss=not|SpaceAfter=No
92 入 入 VERB v,動詞,行為,移動 _ 0 root _ Gloss=enter|SpaceAfter=No
103 虎 虎 NOUN n,名詞,主体,動物 _ 4 nmod _ Gloss=tiger|SpaceAfter=No
114 穴 穴 NOUN n,名詞,固定物,地形 Case=Loc 2 obj _ Gloss=cave|SpaceAfter=No
125 不 不 ADV v,副詞,否定,無界 Polarity=Neg 6 advmod _ Gloss=not|SpaceAfter=No
136 得 得 VERB v,動詞,行為,得失 _ 2 parataxis _ Gloss=get|SpaceAfter=No
147 虎 虎 NOUN n,名詞,主体,動物 _ 8 nmod _ Gloss=tiger|SpaceAfter=No
158 子 子 NOUN n,名詞,人,関係 _ 6 obj _ Gloss=child|SpaceAfter=No
16
17>>> import deplacy
18>>> deplacy.render(doc)
19不 ADV <════╗ advmod
20入 VERB ═══╗═╝═╗ ROOT
21虎 NOUN <╗ ║ ║ nmod
22穴 NOUN ═╝<╝ ║ obj
23不 ADV <════╗ ║ advmod
24得 VERB ═══╗═╝<╝ parataxis
25虎 NOUN <╗ ║ nmod
26子 NOUN ═╝<╝ objsuparkanbun.load() has two options suparkanbun.load(BERT="roberta-classical-chinese-base-char",Danku=False). With the option Danku=True the pipeline tries to segment sentences automatically. Available BERT options are:BERT="roberta-classical-chinese-base-char" utilizes roberta-classical-chinese-base-char (default)BERT="roberta-classical-chinese-large-char" utilizes roberta-classical-chinese-large-charBERT="guwenbert-base" utilizes GuwenBERT-baseBERT="guwenbert-large" utilizes GuwenBERT-largeBERT="sikubert" utilizes SikuBERTBERT="sikuroberta" utilizes SikuRoBERTapip3 install suparkanbun --userpython37-devel python37-pip python37-cython python37-numpy python37-wheel gcc-g++ mingw64-x86_64-gcc-g++ git curl make cmake packages, and then:1curl -L https://raw.githubusercontent.com/KoichiYasuoka/CygTorch/master/installer/supar.sh | sh
2pip3.7 install suparkanbun --no-build-isolation!pip install suparkanbun