Views
No views yet
newstest2014 (En -> De) dataset.| Library | Tokens per Second | Max Memory Usage | BLEU |
|---|---|---|---|
| Transformers 4.26.1 (with PyTorch 1.13.1) | 147.3 | 2332MB | 27.90 |
| Marian 1.11.0 (int16) | 330.2 | 5901MB | 27.65 |
| Marian 1.11.0 (int8) | 355.8 | 4763MB | 27.27 |
| CTranslate2 3.6.0 (int16) | 596.1 | 660MB | 27.53 |
| CTranslate2 3.6.0 (int8) | 696.1 | 516MB | 27.65 |
| Library | Tokens per Second | Max GPU Memory Usage | Max Memory Usage | BLEU |
|---|---|---|---|---|
| Transformers 4.26.1 (with PyTorch 1.13.1) | 1022.9 | 4097MB | 2109MB | 27.90 |
| Marian 1.11.0 (float16) | 3962.4 | 3239MB | 1976MB | 27.94 |
| CTranslate2 3.6.0 (float16) | 9296.7 | 909MB | 814MB | 27.9 |
| CTranslate2 3.6.0 (int8 + float16) | 8362.7 | 813MB | 766MB | 27.9 |
Executed with 4 threads on a c5.2xlarge Amazon EC2 instance equipped with an Intel(R) Xeon(R) Platinum 8275CL CPU.pip install hf-hub-ctranslate2>=1.0.0 ctranslate2>=3.13.0ct2-transformers-converter --model Helsinki-NLP/opus-mt-run-en --output_dir ./ctranslate2/opus-mt-run-en-ctranslate2 --force --copy_files README.md generation_config.json tokenizer_config.json vocab.json source.spm .gitattributes target.spm --quantization float16compute_type=int8_float16 for device="cuda"compute_type=int8 for device="cpu"1from ctranslate2 import Translator
2import transformers
3
4model_name = "gaudi/opus-mt-run-en-ctranslate2"
5translator = Translator(
6 model_path=model_name,
7 device="cuda",
8 inter_threads=1,
9 intra_threads=4,
10 compute_type="int8_float16",
11)
12
13tokenizer = transformers.AutoTokenizer.from_pretrained(model_name)
14
15source = tokenizer.convert_ids_to_tokens(tokenizer.encode("XXXXXX, XXX XX XXXXXX."))
16results = translator.translate_batch([source])
17target = results[0].hypotheses[0]
18
19print(tokenizer.decode(tokenizer.convert_tokens_to_ids(target)))1from hf_hub_ctranslate2 import TranslatorCT2fromHfHub, GeneratorCT2fromHfHub
2from transformers import AutoTokenizer
3
4model_name = "gaudi/opus-mt-run-en-ctranslate2"
5model = TranslatorCT2fromHfHub(
6 model_name_or_path=model_name,
7 device="cuda",
8 compute_type="int8_float16" # load in int8 on CUDA,
9 tokenizer=AutoTokenizer.from_pretrained(model_name)
10)
11outputs = model.generate(
12 text=["XXX XX XXX XXXXXXX XXXX?", "XX XX XXXX XX XXX!"],
13)
14print(outputs)