Views
No views yet
の都合上 や の判定負けを喫し のような複数語のトークンを生じさせない)の都合上 or の判定負けを喫し)1from transformers import AutoTokenizer, AutoModelForTokenClassification
2
3model_name = 'globis-university/deberta-v3-japanese-base'
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForTokenClassification.from_pretrained(model_name)unidic-cwj-202302)xsmall 、 base 、 large の 3 つのモデルのうち、前者二つは unigram アルゴリズムで学習しているが、 large モデルのみ BPE アルゴリズムで学習している。
深い理由はなく、 large モデルのみ語彙サイズを増やすために独立して学習を行ったが、なぜか unigram アルゴリズムでの学習がうまくいかなかったことが原因である。
原因の探究よりモデルの完成を優先して、 BPE アルゴリズムに切り替えた。unidic-cwj-202302)| Dataset Name | Notes | File Size (with metadata) | Factor |
|---|---|---|---|
| Wikipedia | 2023/07; WikiExtractor | 3.5GB | x2 |
| Wikipedia | 2023/07; cl-tohoku's method | 4.8GB | x2 |
| WikiBooks | 2023/07; cl-tohoku's method | 43MB | x2 |
| Aozora Bunko | 2023/07; globis-university/aozorabunko-clean | 496MB | x4 |
| CC-100 | ja | 90GB | x1 |
| mC4 | ja; extracted 10%, with Wikipedia-like focus via DSIR | 91GB | x1 |
| OSCAR 2023 | ja; extracted 10%, with Wikipedia-like focus via DSIR | 26GB | x1 |
| Model | #params | JSTS | JNLI | JSQuAD | JCQA |
|---|---|---|---|---|---|
| ≤ small | |||||
| izumi-lab/deberta-v2-small-japanese | 17.8M | 0.890/0.846 | 0.880 | - | 0.737 |
| globis-university/deberta-v3-japanese-xsmall | 33.7M | 0.916/0.880 | 0.913 | 0.869/0.938 | 0.821 |
| base | |||||
| cl-tohoku/bert-base-japanese-v3 | 111M | 0.919/0.881 | 0.907 | 0.880/0.946 | 0.848 |
| nlp-waseda/roberta-base-japanese | 111M | 0.913/0.873 | 0.895 | 0.864/0.927 | 0.840 |
| izumi-lab/deberta-v2-base-japanese | 110M | 0.919/0.882 | 0.912 | - | 0.859 |
| ku-nlp/deberta-v2-base-japanese | 112M | 0.922/0.886 | 0.922 | 0.899/0.951 | - |
| ku-nlp/deberta-v3-base-japanese | 160M | 0.927/0.891 | 0.927 | 0.896/- | - |
| globis-university/deberta-v3-japanese-base | 110M | 0.925/0.895 | 0.921 | 0.890/0.950 | 0.886 |
| large | |||||
| cl-tohoku/bert-large-japanese-v2 | 337M | 0.926/0.893 | 0.929 | 0.893/0.956 | 0.893 |
| nlp-waseda/roberta-large-japanese | 337M | 0.930/0.896 | 0.924 | 0.884/0.940 | 0.907 |
| nlp-waseda/roberta-large-japanese-seq512 | 337M | 0.926/0.892 | 0.926 | 0.918/0.963 | 0.891 |
| ku-nlp/deberta-v2-large-japanese | 339M | 0.925/0.892 | 0.924 | 0.912/0.959 | - |
| globis-university/deberta-v3-japanese-large | 352M | 0.928/0.896 | 0.924 | 0.896/0.956 | 0.900 |