Fast Chinese to Vietnamese Marian-style machine translation model, trained
for web-novel / xianxia content.
1from transformers import AutoModelForSeq2SeqLM
2model = AutoModelForSeq2SeqLM.from_pretrained("DanVP/MoxhiMT-30", revision="v3.0")
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3model_id = "DanVP/MoxhiMT-30"
4tok = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForSeq2SeqLM.from_pretrained(model_id)
6
7Text = " hắn ngẩng đầu nhìn về phía xa xa sơn môn."
8inputs = tok(text, return_tensors="pt", truncation=True, max_length=512)
9out = model.generate(**inputs, max_length=512, num_beams=4)
10print(tok.decode(out[0], skip_special_tokens=True))
1import ctranslate2
2from pathlib import Path
3from huggingface_hub import snapshot_download
4from transformers import AutoTokenizer
5
6model_id = "DanVP/MoxhiMT-30"
7model_path = Path(snapshot_download(model_id, allow_patterns=[
8 "config.json", "source.spm", "target.spm", "vocab.json",
9 "tokenizer_config.json", "ct2-int8_float32/*",
10]))
11tokenizer = AutoTokenizer.from_pretrained(model_path)
12translator = ctranslate2.Translator(
13 str(model_path / "ct2-int8_float32"),
14 device="cpu", compute_type="int8_float32",
15)
Trained from scratch on a curated Chinese-Vietnamese parallel corpus covering
xianxia, modern fiction, historical, sci-fi, and cross-domain web-novel content,
with a research-grounded layer for idioms and classical-Chinese grammar, then a
light preference-tuning (DPO) pass for xianxia/idiom sharpness.
CC-BY-NC-4.0 (research / non-commercial use).