Views
No views yet
from_pretrained() method followed by the generate() method for immediate use:1from modeling_llama_seq2seq import LlamaCrossAttentionEncDec
2from transformers import AutoTokenizer, AutoConfig
3
4tokenizer = AutoTokenizer.from_pretrained(model_name_or_path)
5config = AutoConfig.from_pretrained(model_name_or_path, trust_remote_code=True)
6model = LlamaCrossAttentionEncDec.from_pretrained(model_name_or_path, config=config)
7
8prompt = "Translate the following text from English into Chinese.\nEnglish: The harder you work at it, the more progress you will make.\nChinese: ",
9input_ids = tokenizer(prompt, return_tensors="pt")
10outputs_tokenized = model.generate(
11 **input_ids,
12 num_beams=5,
13 do_sample=False
14)
15outputs = tokenizer.batch_decode(outputs_tokenized, skip_special_tokens=True)
16print(outputs) @misc{luoyf2025lamate,
title={Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation},
author={Yingfeng Luo, Tong Zheng, Yongyu Mu, Bei Li, Qinghong Zhang, Yongqi Gao, Ziqiang Xu, Peinan Feng, Xiaoqian Liu, Tong Xiao, Jingbo Zhu},
year={2025},
eprint={2503.06594},
archivePrefix={arXiv},
primaryClass={cs.CL}
}