This is a RoBERTa model pre-trained on Ainu texts (in カタカナ, Roman, and Кириллица) for POS-tagging and dependency-parsing, derived from
roberta-base-ainu. Every word is tagged by
UPOS (Universal Part-Of-Speech).
1from transformers import AutoTokenizer,AutoModelForTokenClassification
2tokenizer=AutoTokenizer.from_pretrained("KoichiYasuoka/roberta-base-ainu-upos")
3model=AutoModelForTokenClassification.from_pretrained("KoichiYasuoka/roberta-base-ainu-upos")
1import esupar
2nlp=esupar.load("KoichiYasuoka/roberta-base-ainu-upos")
安岡孝一:
ローマ字・カタカナ・キリル文字併用アイヌ語RoBERTa・DeBERTaモデルの開発, 情報処理学会研究報告, Vol.2023-CH-131『人文科学とコンピュータ』, No.7 (2023年2月18日), pp.1-7.
esupar: Tokenizer POS-tagger and Dependency-parser with BERT/RoBERTa/DeBERTa models