ONNX export with dynamic int8 quantization (AVX2) of
Helsinki-NLP/opus-mt-tc-big-en-pt.
1from optimum.onnxruntime import ORTModelForSeq2SeqLM
2from transformers import AutoTokenizer
3
4tok = AutoTokenizer.from_pretrained("Helsinki-NLP/opus-mt-tc-big-en-pt")
5model = ORTModelForSeq2SeqLM.from_pretrained(
6 "R4kSo1997/opus-mt-en-pt-onnx-int8",
7 encoder_file_name="encoder_model_quantized.onnx",
8 decoder_file_name="decoder_model_quantized.onnx",
9 decoder_with_past_file_name="decoder_with_past_model_quantized.onnx",
10)
11out = model.generate(**tok("Hello, how are you?", return_tensors="pt"), num_beams=4)
12print(tok.batch_decode(out, skip_special_tokens=True))
Inherits CC-BY-4.0 from the upstream Helsinki-NLP model.