Views
No views yet
"Enfoques de traducción automática con modelos de lenguaje en obras wuxia" (Degree in Data Science and Engineering, Universidade da Coruña)
1from transformers import M2M100ForConditionalGeneration, M2M100Tokenizer
2
3model_name = "HSilvosa/hsc-wuxia-m2m100-418m"
4model = M2M100ForConditionalGeneration.from_pretrained(model_name)
5tokenizer = M2M100Tokenizer.from_pretrained(model_name)
6
7# Set source and target language
8tokenizer.src_lang = "zh"
9text = "一念成沧海,一念化桑田。"
10
11encoded_zh = tokenizer(text, return_tensors="pt")
12generated_tokens = model.generate(**encoded_zh, forced_bos_token_id=tokenizer.get_lang_id("en"))
13print(tokenizer.batch_decode(generated_tokens, skip_special_tokens=True)[0])| Metric | Base Model (m2m100_418M) | Fine-tuned Model (hsc-wuxia-m2m100-418m) | Delta (Improvement) |
|---|---|---|---|
| SacreBLEU | 5.10 | 33.09 | +27.99 |
| chrF | 25.19 | 53.24 | +28.05 |
| ROUGE-L | 27.27 | 60.07 | +32.80 |
| METEOR | 24.16 | 59.03 | +34.87 |
| COMET | 56.17 | 78.52 | +22.35 |