Japanese to Korean translator model based on
EncoderDecoderModel(
bert-japanese+
kogpt2)
1from transformers import(
2 EncoderDecoderModel,
3 PreTrainedTokenizerFast,
4 BertJapaneseTokenizer,
5)
6
7import torch
8
9encoder_model_name = "cl-tohoku/bert-base-japanese-v2"
10decoder_model_name = "skt/kogpt2-base-v2"
11
12src_tokenizer = BertJapaneseTokenizer.from_pretrained(encoder_model_name)
13trg_tokenizer = PreTrainedTokenizerFast.from_pretrained(decoder_model_name)
14
15model = EncoderDecoderModel.from_pretrained("sappho192/aihub-ja-ko-translator")
16
17text = "初めまして。よろしくお願いします。"
18
19def translate(text_src):
20 embeddings = src_tokenizer(text_src, return_attention_mask=False, return_token_type_ids=False, return_tensors='pt')
21 embeddings = {k: v for k, v in embeddings.items()}
22 output = model.generate(**embeddings, max_length=500)[0, 1:-1]
23 text_trg = trg_tokenizer.decode(output.cpu())
24 return text_trg
25
26print(translate(text))
This model used datasets from 'The Open AI Dataset Project (AI-Hub, South Korea)'.
All data information can be accessed through 'AI-Hub (
aihub.or.kr)'.
(
In order for a corporation, organization, or individual located outside of Korea to use AI data, etc., a separate agreement is required with the performing organization and the Korea National Information Society agency(NIA). In order to export AI data, etc. outside the country, a separate agreement is required with the performing organization and the NIA.
Link)
이 모델은 과학기술정보통신부의 재원으로 한국지능정보사회진흥원의 지원을 받아 구축된 데이터셋을 활용하여 수행된 연구입니다.
본 모델에 활용된 데이터는 AI 허브(
aihub.or.kr)에서 다운로드 받으실 수 있습니다.
(
국외에 소재하는 법인, 단체 또는 개인이 AI데이터 등을 이용하기 위해서는 수행기관 등 및 한국지능정보사회진흥원과 별도로 합의가 필요합니다.
본 AI데이터 등의 국외 반출을 위해서는 수행기관 등 및 한국지능정보사회진흥원과 별도로 합의가 필요합니다. [
출처])
To reproduce the the merged dataset, you can use the code in below link:
https://github.com/sappho192/aihub-translation-dataset