Views
No views yet
optimum.onnxruntime.ORTModelForSeq2SeqLM.optimum-cli export onnx --model Helsinki-NLP/opus-mt-fr-ca --task text2text-generation-with-past --no-post-process fr-caonnxruntime.quantization.quantize_dynamic (QUInt8).encoder_model.onnx
decoder_model.onnx
decoder_with_past_model.onnx
config.json / generation_config.json
source.spm / target.spm / vocab.json / tokenizer_config.json / special_tokens_map.json
int8/
encoder_model.onnx
decoder_model.onnx
decoder_with_past_model.onnxnum_beams=4, max_new_tokens=48:| input | PyTorch | ONNX fp32 | ONNX int8 |
|---|---|---|---|
| Bonjour, comment vas-tu? | Hola, com estàs? | Hola, com estàs? | Hola, com estàs? |
| Le chien court dans le parc. | El gos corre cap al parc. | El gos corre cap al parc. | El gos corre cap al parc. |
| Bonne journee a tous. | Que tingui un bon dia. | Que tingui un bon dia. | Que tingui un bon dia. |
1from transformers import AutoTokenizer
2from optimum.onnxruntime import ORTModelForSeq2SeqLM
3
4model_id = "TigreGotico/opus-mt-fr-ca-onnx"
5tok = AutoTokenizer.from_pretrained(model_id)
6model = ORTModelForSeq2SeqLM.from_pretrained(model_id)
7
8inputs = tok("Bonjour, comment vas-tu?", return_tensors="pt")
9out = model.generate(**inputs, num_beams=4, max_new_tokens=48)
10print(tok.decode(out[0], skip_special_tokens=True))int8/ subfolder:model = ORTModelForSeq2SeqLM.from_pretrained(model_id, subfolder="int8")