Views
No views yet

| Source Language | Target Language | BLEU Score | ROUGE-1 | ROUGE-L |
|---|---|---|---|---|
| Korean | Vietnamese | 56.70 | 81.64 | 76.66 |
| Korean | Cambodian | 71.69 | 89.26 | 88.20 |
| Korean | Indonesian | 58.32 | 80.39 | 76.63 |
| Korean | Thai | 63.26 | 78.88 | 72.29 |
| Vietnamese | Korean | 49.01 | 75.57 | 72.74 |
| Vietnamese | Cambodian | 78.26 | 90.74 | 90.32 |
| Vietnamese | Indonesian | 65.96 | 83.08 | 81.46 |
| Vietnamese | Thai | 65.93 | 81.09 | 76.57 |
| Cambodian | Korean | 49.10 | 72.67 | 69.75 |
| Cambodian | Vietnamese | 63.42 | 81.56 | 79.09 |
| Cambodian | Indonesian | 61.41 | 79.67 | 77.75 |
| Cambodian | Thai | 70.91 | 81.85 | 77.66 |
| Indonesian | Korean | 53.61 | 77.14 | 74.29 |
| Indonesian | Vietnamese | 68.21 | 85.41 | 83.10 |
| Indonesian | Cambodian | 78.84 | 90.81 | 90.35 |
| Indonesian | Thai | 67.12 | 81.54 | 77.19 |
| Thai | Korean | 45.59 | 72.48 | 69.46 |
| Thai | Vietnamese | 61.55 | 81.01 | 78.24 |
| Thai | Cambodian | 78.52 | 91.47 | 91.16 |
| Thai | Indonesian | 58.99 | 78.56 | 76.40 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "MLP-KTLim/llama-3.1-Asian-Bllossom-8B-Translator",
5 torch_dtype="auto",
6 device_map="auto",
7)
8
9tokenizer = AutoTokenizer.from_pretrained(
10 "MLP-KTLim/llama-3.1-Asian-Bllossom-8B-Translator",
11)
12
13input_text = "안녕하세요? 아시아 언어 번역 모델 입니다."
14
15def get_input_ids(source_lang, target_lang, message):
16 assert source_lang in ["Korean", "Vietnamese", "Indonesian", "Thai", "Cambodian"]
17 assert target_lang in ["Korean", "Vietnamese", "Indonesian", "Thai", "Cambodian"]
18
19 input_ids = tokenizer.apply_chat_template(
20 conversation=[
21 {"role": "system", "content": f"You are a useful translation AI. Please translate the sentence given in {source_lang} into {target_lang}."},
22 {"role": "user", "content": message},
23 ],
24 tokenize=True,
25 return_tensors="pt",
26 add_generation_prompt=True,
27 )
28 return input_ids
29
30input_ids = get_input_ids(
31 source_lang="Korean",
32 target_lang="Vietnamese",
33 message=input_text,
34)
35
36output = model.generate(
37 input_ids.to(model.device),
38 max_new_tokens=128,
39)
40
41print(tokenizer.decode(output[0][len(input_ids[0]):], skip_special_tokens=True))